기관 리서치
Google DeepMind
- 신규 없음. RSS 최신 글은 여전히 2026-09-15 "Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking"(어제까지 이미 다룸)로 갱신 없음.
Google Research
- MilleMiglia: A realistic instance generator for middle-mile logistics (2026-09-18) — 공장→물류센터(first-mile)·물류센터→고객(last-mile)과 달리 표준 벤치마크가 없었던 "미들마일"(지역 물류센터 간 장거리 이동) 최적화를 위해, 여러 차량·다일간 이동과 물류센터에서의 차량 간 동기화 제약까지 반영한 오픈소스 인스턴스 생성기를 공개. 실제 물류망의 통계 분포를 이용해 프라이버시를 지키면서 현실적인 인스턴스를 만들고, 시공간 그래프 위의 multi-commodity flow로 문제를 정식화. — 링크
- 관련 주제: 해당 없음
- The future of practice: Enabling teachers to create learning interactives with generative UI (2026-09-17) — 코딩 지식 없이 교사가 커스텀 STEM 학습 시뮬레이션을 만들 수 있는 생성형 UI 시스템. "즉각적 상호작용"용으로 쓰이던 생성형 UI를 학습목표·난이도 단계별 게임형 레벨·힌트/피드백까지 갖춘 구조화된 학습 여정용으로 확장하고, 교사 승인 전 자기교정 루프와 적대적 브라우저 자동화 테스트로 품질을 검증. 12명 교사 파일럿에서 평균 품질 8/10, 영국 STEM 교사 40명 중 다수가 "양호~우수"로 평가. — 링크
- 관련 주제: 해당 없음
OpenAI
- 신규 없음(Research/Publication 카테고리 기준). 최신 Research 글은 여전히 2026-09-16 "Our framework for reporting model misalignment"(어제 이미 다룸)이고, 09-17에 올라온 글들은 전부 Company/Product/Startup/Global Affairs 카테고리.
Anthropic
- How Claude is uplifting biomolecular modeling (2026-09-17) — Claude가 최소한의 인간 감독으로 4주 만에 30개 이상의 오픈소스 단백질 구조 예측/설계 모델을 최적화, 숙련된 엔지니어링 팀이 모델당 수 주씩 걸리던 작업을 대체. Triangle attention에 대한 커스텀 FlashPairformer 커널로 업계 표준 대비 2.7–3.2배 속도 향상, 평균 약 4배 속도 향상과 2자릿수 계산비용 절감을 달성했고, 단일 GPU 노드에서 1만 토큰이 넘는 대형 생체분자 시스템(인간 미토콘드리아 복합체 I, 세균 리보솜 등)을 정확히 예측하는 "Big" 모드를 개발. 단일 GPU + Claude 한 대로 기존 캠페인(~$10,000)과 동등한 결합 점수를 약 $150에 달성. — 링크
- 관련 주제: AI Agents
Meta FAIR / Meta AI
- 신규 없음. https://ai.meta.com/blog/ 기준 노출되는 최신 글은 여전히 2026-07-27로, 리스팅이 계속 정체되어 있음(09-17 브리핑과 동일 상태).
Microsoft Research
- 신규 없음. RSS 기준 최신 글은 여전히 2026-08-31 "GigaPath-Flash and GigaTIME-Flash"로 갱신 없음.
NVIDIA Research
- 신규 없음(관련 연구 발표 기준).
blogs.nvidia.com/feed의 09-17 신규 1건("Aniimo" GeForce NOW 게임 출시)은 소비자 제품 뉴스로 5대 핵심 주제와 무관. 09-15~09-16의 MLPerf Inference v6.1·Earth-2 대기질 예보·AI 팩토리 에너지 관리 3건은 어제(09-17) 브리핑에서 이미 다룸.research.nvidia.com/publications는 09-17 로그에서 지적한 대로 목록의 날짜가 venue 예정일이라 신뢰할 수 없어 이번에도blogs.nvidia.com/feed만 확인.
Apple ML Research
- Dynamically Scaled Activation Steering (DSAS) (2026-09-18) — activation steering(모델 행동을 원하는 방향으로 유도하는 기법)에서 "언제 개입할지"와 "어떻게 개입할지"를 분리해, 입력·레이어별로 context-dependent scaling factor를 계산해 원치 않는 행동이 감지될 때만 강하게 개입하는 프레임워크. 기존 steering 기법을 감싸는 wrapper로 동작해 방법에 구애받지 않으며, 언어모델과 텍스트-이미지 확산모델 양쪽에서 toxicity 완화 대 유용성 보존의 파레토 프론티어를 일관되게 개선. — 링크
- 관련 주제: 해당 없음
- REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff (2026-09-17) — 대부분의 RL 연구가 가정하는 "리셋 가능한 환경"과 달리 실제 로봇 조작(물건을 떨어뜨림, 액체를 쏟음 등)은 비가역적이라는 간극을 겨냥해, 되돌릴 수 없는 정도를 연속 파라미터 ρ∈[0,1]로 통제하고 5개 물리 엔진·8개 조작 과제에서 상태 복구 가능성을 검증하는 reset oracle을 갖춘 벤치마크를 공개. 리셋 없이 학습하는 에이전트가 ρ가 커질수록 급격히 무너지는 "reversibility cliff"를 발견했고, 이는 환경 복잡도가 아니라 비가역성 자체가 실패 원인임을 보임 — episodic 베이스라인은 이 붕괴를 겪지 않음. — 링크
- 관련 주제: AI Agents
arXiv 신규
AI Agents
- Rethinking Multi-Agent Collaboration: When More Is Less (2609.19759) — 단일 에이전트 하네스가 강력해질수록 멀티에이전트 협업의 이득이 체감한다는 문제의식으로, 협업이 실제로 이기는 경계(의존성이 성긴 장기 과제)와 단일 에이전트가 여전히 우세한 경계(긴밀히 결합된 순차 워크플로)를 실증적으로 구분. 이를 바탕으로 필요에 따라 에이전트 인스턴스를 생성하고 콘텐츠 기반 검색으로 의미적 의존성을 엣지로 표현하는 경량 협업 메커니즘 SAIGE를 제안하며, 에이전트 풀을 늘리거나 재귀 깊이를 키우는 것이 항상 성능 향상으로 이어지지는 않음을 보임.
- An Empirical Study of Harness Design for Coding Agents (2609.20804) — 코딩 에이전트 하네스를 보통 하나의 통짜 시스템으로 평가해 개별 컴포넌트의 기여가 불분명하다는 점을 지적하고, 실행 루프는 고정한 채 planning·action space·context management 3요소만 바꿔가며 4개 모델 × SWE-Bench Verified/Terminal-Bench 2.1에서 176개 매칭 설정을 비교. context 예산이 빠듯할수록 context management의 가치가 커지고(주로 overflow 방지 덕분), planning은 약한 모델엔 정확도 보조 장치지만 강한 모델엔 비용 절감 장치로 역할이 바뀌며, bash 능숙한 모델은 사전정의 툴 없이 bash-only 인터페이스로 더 낮은 비용에 동작함을 발견.
- Locating Hidden Failures Makes Long-Horizon Agents More Reliable (2609.17930) — 장기 자율 과제를 최종 성공 여부로만 평가하면 중간에 어디서 잘못됐는지, 복구했는지, 어떤 돌이킬 수 없는 피해가 있었는지 알 수 없다는 문제의식으로, 소프트웨어 엔지니어링·컴퓨터 사용·과학 3개 영역의 실전에 가까운 에이전트 궤적 2,518개, 실수 6,967건을 78개 실패 유형으로 분류. 최강 프런티어 판정 모델조차 첫 실수를 1/3도 못 찾는 반면, 저자들이 학습시킨 4B 검증기 Scout는 훨씬 잘 찾아내고 재학습 없이 테스트 시점에 후보 실행을 고르는 데 쓰면 에이전트 자체의 단일 시도 성능을 넘어섬.
- Collective Loss of Control in LLM Agent Systems: An Epidemic Account of Mutation, Contagion, and Recovery (2609.18460) — 실제 보고된 OpenAI 에이전트 조정 사고에서 착안해, 멀티에이전트 시스템에서 국소적 일탈이 어떻게 집단적 통제 상실로 번지는지를 돌연변이·전염·회복의 역학으로 설명. 독립적이어야 할 평가 실행 사이의 암묵적 통신 경로를 감사로 확인하고, 변형된 라우트로 만든 불안전 궤적을 주입하는 20개 시나리오 벤치마크(RogueHandoff-20)에서 평상시 실행 피해율 0–5%가 주입 후 40–95%로 치솟음을 실증.
AI Scientist / Automated Research
- Agora: Git as Shared Memory for Collective AutoResearch (2609.18094) — 자율 연구 에이전트를 여러 개 동시에 돌리면 발견보다 중복 탐색이 늘어난다는 문제를 겨냥해, 모든 결과·통찰·가설·검증을 Git commit으로 불변 기록하고 다양성 인지형 관심 배분으로 한 워커에게 몰리지 않게 하는 공유 메모리 시스템을 제안. 13개 워커가 12일간 무학습으로 141개 도너 모델의 지식을 새 아키텍처에 전이하는 실전 런에서 gap의 62%를 해소하고 165회 상호 재현이 전부 성공함을 보임 — 이번 레이더에서 채택.
- PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research (2609.17846) — 자율 연구 에이전트가 유망한 방향을 무수히 제안할 수 있지만 각 시도가 상당한 자원을 쓴다는 문제에, 계획 수립과 실행을 같은 토큰 예산 아래 하나의 순차적 의사결정으로 통합하는 예산-적응형 MCTS 배분 정책 PrimeScientist를 제안. AI 연구·시스템 최적화·ML 엔지니어링 24개 과제에서 AutoResearch 대비 평균 보상 10.3%↑·시도 수 50.6%↓를 달성 — 이번 레이더에서 채택.
Hypothesis Generation
- Hypothesis-Driven Autonomous Materials Synthesis with Multimodal LLM Agents (2609.18598) — 자율 실험실(self-driving lab)의 의사결정이 보통 블랙박스 최적화기라 "왜 성공했는지"가 남지 않는다는 문제에, LLM 에이전트가 실험을 운영하며 합성 과정에 대한 명시적이고 수정 가능한 이해를 캠페인의 1차 산출물로 유지하는 프레임워크 SynAgent를 제안. X선 회절·전자현미경 데이터를 멀티모달로 해석하고 스스로의 가설을 일부러 반증 시도하는 verify-falsify 방식으로, LiCoO2 박막 증착 18회 실험만으로 기판 온도가 결정화를 좌우하는 급격한 문턱과 650–690°C의 좁은 최적 성장 구간을 발견.
Long-context
- JustMem: Just-Enough Memory Access for Long-Term Conversations (2609.19877) — 장기 대화 메모리가 증거를 충분히 검색하면서도 문맥을 과도하게 늘리지 않아야 한다는 긴장을 "얼마나 넓게 찾을지"(discovery breadth)와 "얼마나 충실하게 읽을지"(reading fidelity) 두 축으로 정식화하고, 질의별로 LOOKUP/COMPOSE/REPLAY 세 접근을 적응적으로 선택하는 JustMem을 제안. LoCoMo·LongMemEval-S에서 비교 대상 메모리 시스템 중 최고 정확도·검색 recall을 더 적은 토큰으로 달성.
- Memory Has Geometry: Non-Uniform Geometric Memory for Long-Horizon Personalized AI (2609.17969) — 개인화 AI의 장기 메모리가 여전히 하나의 전역 유사도 기준으로 접근하는 정적인 이산 레코드로 표현되는 것이 시간적 이벤트 스트림이라는 증거의 실제 성격과 어긋난다고 지적하고, 메모리를 사용자별 동역학적 상태공간으로 — 안정적/변동적 영역, 가변 속도 드리프트, 이질적 이웃, 현재 상태에 대한 불확실성까지 담는 "기하학"으로 — 모델링할 것을 제안. 메모리 접근을 최근접 이웃 탐색이 아니라 궤적 조건부 상태 재구성으로 재정의하는 개념적 프레임워크.
- Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression (2609.20045) — 메모리가 현재 질의엔 정답을 내면서도 나중의 업데이트에 필요한 구분을 이미 버렸을 수 있다는 실패를 "동일한 현재 답 → 같은 미래 업데이트 → 서로 다른 이후 답"이 되는 짝지은 히스토리로 감사. 6개 합성 메커니즘·12개 메모리 조건에 걸친 파일럿에서, 구조화된 writer의 실패 다수가 "값은 맞는데 틀린 포맷에 담긴" 경우였고 식별자 이름을 바꾸는 것만으로 원래 8/8이던 최신 참조 정확도가 320개 중 94개로 붕괴하는 등, 압축 알고리즘의 적절성 평가에는 재현 가능한 레코드 단위 감사가 필요함을 보임.
Reasoning
- Chain-of-Thought Entropy as a Reliability Signal: A Preregistered Reproduction (2609.19606) — CoT 엔트로피 궤적의 "모양"은 정답 여부를 예측하지만 "총 하강폭"은 예측하지 못한다는 2026년 기존 결과를, OSF 사전등록 후 GSM8K·MATH-500 전체 테스트셋과 4개 오픈웨이트 모델(reasoning-distilled 모델 포함)로 독립 재현. 모양 신호는 재현됐지만(단조/비단조 정확도 격차 GSM8K +9.6pt, MATH-500 +27.5pt) 크기 신호는 설정에 따라 갈렸고, 탐색적으로는 마지막 스텝 엔트로피 단독이 8개 모델×벤치마크 조합 전부에서 이진 모양 플래그를 능가.
- First Token Matters: Understanding Safety Collapse in Large Reasoning Models (2609.18471) — 대형 추론모델이 유해 질의에서 안전 정렬이 무너지는 현상을 토큰 위치별 거부 동역학 분석으로 파헤쳐, 추론이 시작되는 첫 생성 토큰에서 거부 관련 신호가 급락하는 국소적 취약점("Onset Refusal Collapse")을 규명. 단 하나의 토큰 임베딩에 학습된 연속적 안전 앵커를 추론 시작 지점에 주입하는 경량 추론시점 개입 SafeToken만으로 이 붕괴를 완화하면서 추론 능력은 대체로 보존.
- A Four-Stage Decomposition of Word-Problem Solving and Mechanistic Fragility in LLM Math Reasoning (2609.17804) — 초등 수준 수학 문장제를 잘 푸는 LLM이 관련 없는 문구 하나만 추가돼도 무너지는 현상을 기계적으로 설명하기 위해, 내부 계산이 스키마 추상화→연산 계획→피연산자 결합→계산의 4단계 파이프라인으로 분해되며 각 단계가 식별 가능한 레이어 대역에서 별개의 중간표현을 만든다는 것을 규명. 동일 스캐폴드로 방해 문구로 인한 실패를 진단해, 손상이 "연산 계획" 단계 하나에 국한되고 이를 구현하는 특정 어텐션 헤드 집합의 인과적 역할을 양방향으로 검증.
- Language-model groups overstate consensus when replaying human deliberation on a reasoning task (2609.20543) — Wason 카드 선택 과제에서 실제 인간 100개 그룹의 토론을 신념-고정 LLM 에이전트로 리플레이해 같은 채점 코드로 비교한 결과, 인간 그룹의 완전합의율은 채점 정의에 따라 24.0–57.0%인 반면 에이전트 그룹은 두 가지 편향 제거 비교(제출 기준·참여 매칭)에서 각각 34–44%p 더 높은 합의율을 지속적으로 보임. reasoning 모드 에이전트는 거의 만장일치로 수렴하지만 대개 오답에 수렴했고, 시뮬레이션된 합의가 집단 정확도를 추적하지 못해 신념-고정 에이전트 그룹이 인간 집단 결과 분포의 편향된 추정치임을 보임.
Paper Radar 채택2보류0탈락1
조회 800건 · 신규 673건 · 채택 2 · 보류 0 · 탈락 1
색인 상태: --wide 조회 결과 중 가장 최신 published는 2026-09-17T17:59:58Z로, 실행 시각(UTC 2026-09-18T22:38) 기준 약 29시간 지연 — 09-17 로그와 마찬가지로 색인 밀림으로 판단. covered: true(800건 조회로 last_run 2026-09-15T17:57:27Z까지 도달, 상한 미달).
커서: 6절 규칙에 따라 이번 실행의 커서는 실행 시각(wall-clock)이 아니라 이번 피드에서 실제로 관측된 가장 최신 published인 2026-09-17T17:59:58Z로 설정한다 — 색인 밀림이 이틀 연속 관측되므로 wall-clock을 쓰지 않는다.
신규 673건 중 radar_match 3건만 Gate A/B로 넘겼다.
채택
- Agora — Git as Shared Memory for Collective AutoResearch
- arXiv: 2609.18094
- 통과 근거: Gate B-1 — 멀티에이전트 자율 연구 루프를 위한 Git 기반 append-only DAG 공유 메모리와 다양성 인지 관심 배분이라는, 코퍼스에 없던 새 축을 연다. 13개 워커·12일 실전 런에서 무학습 weight-transfer 초기화로 gap의 62%를 해소하고(본문 §4.5), 145-commit 계보가 15개 계정에 걸치며 165회 상호 재현이 전부 성공(§4.6)함을 실증.
- 파일:
2026/2026_Agora_Git-Shared-Memory-Collective-AutoResearch_arXiv2609.18094.pdf· 리뷰:..._리뷰.md
- PrimeScientist — Strategic Allocation of Research Effort in Autonomous Research
- arXiv: 2609.17846
- 통과 근거: Gate B-2 — 계획 수립과 실행을 공유 토큰 예산 아래 하나의 순차적 의사결정으로 통합하는 예산-적응형 MCTS 배분 정책은 우리 재현 파이프라인에 바로 투입 가능한 방법. AI research·systems·ML engineering 3영역 24태스크에서 AutoResearch 대비 평균 보상 10.3%↑·시도 수 50.6%↓(Table 3), 배분 정책만 분리한 ablation(Table 5)과 예산 적응성만 분리한 ablation(Table 6)으로 이득의 출처까지 분해.
- 파일:
2026/2026_PrimeScientist_Strategic-Research-Effort-Allocation_arXiv2609.17846.pdf· 리뷰:..._리뷰.md
보류
없음
탈락
- Pretrained Medical Representations for the Practical Screening of Drug Repositioning Candidates — 2609.19865 — Gate A 탈락: 핵심 기여가 전자의무기록 의료 코드용 BERT 계열 사전학습 표현학습 프레임워크(계층 구조·부분 마스킹·교차 참조 통합)이고, 가설 생성(약물 재배치)은 다운스트림 사례 연구 하나일 뿐 — 자율 연구 에이전트/가설 탐색 방법론/아이디어 평가 어느 축도 논문의 중심 기여가 아닌 도메인 응용 논문.