기관 리서치
Google DeepMind
- 신규 없음 (Gemini 4 Argon·SynthID Bio는 어제(2026-10-01) 브리핑에서 이미 다룸; 그 이후 새 게시물 없음)
Google Research
- 신규 없음 (직전 브리핑에서 다룬 Diffusion Controller 이후 새 게시물 없음)
OpenAI
- 신규 없음 (RSS 기준 Research/Publication 카테고리에 최근 3일 내 신규 없음)
Anthropic
- Claude-shaped science — LLM이 과학자처럼 일하지는 않지만("impedance mismatch") 모델의 실제 강점(넓은 분야 지식, 강한 코딩력, 빠른 정보처리)에 맞는 "Claude-shaped 문제"를 고르면 과학적으로 유의미한 산출이 가능하다는 사례 모음. 물리학자 Matthew Schwartz가 만든 오픈소스 하네스 BootLoops로 3개월간 18개 분야·19명의 협력자와 36편의 원고를 관리했고, 이전에 못 풀던 15개 elliptic Feynman 적분을 bootstrap 방법으로 새로 풀고 Watson의 "final problem"(3차원 랜덤워크 확률)을 해결했으며, 생태학에서는 Barro Colorado Island 수종 구성 변화가 중립이론 예측보다 4.5배 빠르다는 것을, 집단유전학에서는 1000 Genomes Project의 57억 돌연변이 쌍을 분석해 기존 분석이 놓친 유전자 변환 메커니즘을 확인. 4,452편의 경제학 논문 코드(3만+ 루틴)를 오픈소스로 전환하기도 함. 핵심 주장은 AI가 과학적 방법 자체를 혁신하기보다 "한 사람이 모든 기법을 통달하지 못해 비어 있던" 분야 간 틈을 메우고 지루한 계산을 자동화해 연구자가 개념적 작업에 집중하게 한다는 것. — 링크
- 관련 주제: AI Scientist / Automated Research
Meta FAIR / Meta AI
- 신규 없음 (최근 게시물은 2026-07-27자로 확인, 그 이후 갱신 없음)
Microsoft Research
- 신규 없음 (Quine은 2026-09-30 브리핑, 우주기상 위험 예보는 어제 브리핑에서 이미 다룸; MSR Asia 싱가포르 1주년 회고는 연구 결과가 없는 조직 소식이라 제외)
NVIDIA Research
- NVIDIA·CoreWeave, 에이전틱 AI의 훈련-배포 루프를 닫다 —
research.nvidia.com/publications는 여전히 미래 발행 예정일만 나열해blogs.nvidia.com/feed로 대체 확인. CoreWeave가 Spectrum-X 이더넷을 갖춘 NVIDIA Vera Rubin NVL72 시스템의 프로덕션 가용성을 발표했고, Devin AI 코딩 에이전트 개발사 Cognition이 GB200 NVL72 대비 SWE-2 추론 워크로드에서 총 토큰 처리량 최대 4.8배 증가를 확인. CoreWeave Forge도 함께 공개되어 모델 훈련·평가·개선 인프라를 하나로 통합. 순수 연구보다 인프라/제품 발표에 가깝지만 정량 수치가 있어 포함. — 링크- 관련 주제: AI Agents
Apple ML Research
- How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering? — 자율 ML 엔지니어링(MLE) 에이전트가 최근 멀티에이전트 오케스트레이터·전용 검색 서브에이전트 등 점점 정교해지는 "하네스" 위에 배포되는 추세에, 동일 시간 예산·동일 프런티어 LLM 백본에서 이를 최소 하네스(코딩 에이전트가 read/write/bash로 실행 환경에 직접 접근) 베이스라인과 비교. 오픈소스 최신 하네스들이 단일 세션 최소 하네스 베이스라인 대비 이점이 없음을 대규모 체계적 ablation으로 확인, 모델 백본이 성능의 주 동인이고 하네스 기계장치는 현재 MLE 벤치마크에서 수익이 낮다고 결론. (같은 제목의 arXiv 논문[2609.40303]이 2절에서도 다뤄짐 — 🏢 기관·arXiv 동시 발표) — 링크
- 관련 주제: AI Agents
- RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback — 검증 가능 보상 기반 RL이 과업이 극도로 어려워 성공률이 거의 0(교사 모델도 없음)인 상황에서 무력하다는 문제에, 실패한 시도 후 모델 스스로 "한 줄 교훈(TL;DR)"을 써서 이후 rollout에 반영하고 이를 역전파해 과업→교훈 매핑을 내재화하는 RLTL;DR을 제안. Pass@128=0으로 걸러낸 어려운 툴콜·코딩 데이터셋에서 표준 GRPO는 Pass@1 0–1%에 그치는 반면, 훈련 중 교훈을 포함한 RLTL;DR은 14–31%, 평가 시 교훈 없이도 12–13%를 유지했고, rollout 없이 (과업,교훈) 쌍 4,000개만으로 학습하는 SFTL;DR 변형도 거의 동등한 성능을 회복. — 링크
- 관련 주제: Reasoning
arXiv 신규
AI Agents
- How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering? (2609.40303) — 위 Apple ML Research 항목과 동일 논문. 멀티에이전트 오케스트레이터·검색 서브에이전트 등 정교한 하네스가 동일 예산·백본 조건에서 최소 하네스 코딩 에이전트 대비 이점이 없다는 대규모 ablation 결과.
- 🏢 Apple ML Research 블로그와 동시 발표
- Agent Error Dataset: Scaling 50,000 Error–Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training (2609.40111) — 실패한 LLM 에이전트 rollout에 담긴 관측·행동·환경 반응을 재사용하려면 "무엇을 고칠지" 식별과 대안 검증이 필요하다는 문제의식으로, 33개 환경·19개 하네스·23개 정책 모델에 걸친 50,228개 오류-진단 쌍 데이터셋과 5단계 Agentic Error-to-Training 파이프라인을 공개. 매칭된 replay 3,062쌍에서 1차 교정 제안이 검증 통과율을 18.4%→51.1%(+32.7%p)로 높였고, 진단 전용 파인튜닝은 Qwen3-8B의 내부 교사 라벨 일치율을 47.2%→63.6%로 개선(최강 프롬프트 참조선 54.7% 상회).
AI Scientist / Automated Research
- EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery (2609.40340) — LLM 기반 진화적 탐색이 모델이 모르는 외부 지식을 필요로 할 때 정체되고, 단순히 웹 검색 도구를 붙이면 해가 바뀌어도 같은 문서만 반복 반환되는 문제에, 고정된 모델 파라미터로 해와 검색 쿼리를 함께 진화시키는 bilevel 최적화(EvoDuet)를 제안 — 검색 게이트가 지식 공백을 판단해 신규 검색/재사용/무검색 중 선택. 21개 최적화 과제에서 OpenEvolve의 정규화 발견 이득을 GPT-5.6-Luna는 74.1%→78.0%, Gemini-3.8-Flash는 61.3%→82.3%로 높였으나 Qwen3.5-9B에서는 효과 없음; Swap Reduction on Q20·Rosetta 등 8개 과제에서 기존 최고 기록을 경신.
- ConflictGuide: AutoResearch Improves When Competing Behaviors Are Made Visible (2609.39933) — 스칼라 태스크 지표만 보는 AutoResearch 루프가 ML에 흔한 "경쟁 행동"(한쪽 개선이 다른 쪽을 악화) 트레이드오프를 전혀 보지 못한다는 문제에, 문헌 기반 분류체계로 모델별 경쟁 행동을 probe로 노출시켜 스칼라 탐색이 정체되는 시점부터 2단계로 유도하는 방법을 제시. 5개 이질적 모델군·4개 코딩 에이전트에서 태스크 오류 최대 28%, 충돌 관련 오류 최대 14% 감소.
- 🎯 Paper Radar 채택 (근거: 3절 참고)
Long-context
- RoPE at the End of Its Rope? Theory, Diagnosis, and Mitigation of Long-Context Failures (2609.39929) — RoPE가 안정적 토큰 선호 유지와 인접 위치 구분이라는 내재적 트레이드오프를 안고 있어 장문맥에서 실패한다는 문제에, 주파수별 쿼리-키 스케일 불균등을 허용하는 이론으로 개별 헤드·입력별 두 취약점(의미적 역전, 위치 둔감)을 측정 가능하게 만들고, 캐시된 활성값을 재사용해 추가 forward pass 없이 진단하는 RoPE Profiler를 공개. 49개 장문맥 태스크 평가에서 추론 과제는 주로 의미적 역전에, 검색 과제는 주로 위치 둔감에 취약하다는 뚜렷한 패턴을 확인했고, 이론이 제안하는 고주파 성분 재조정만으로 추가 훈련 없이 Qwen3-8B 최대 20%p, Llama-3.1-8B-Instruct 최대 25%p 정확도 개선.
Reasoning
- What Limits Recursive Reasoning Models: Optimization, Architecture and Test-Time Scaling (2609.39967) — HRM·TRM·URM 등 작은 공유 Transformer 블록을 반복 적용하는 recursive reasoning 모델들이 아키텍처·그래디언트 전파·훈련 절차를 동시에 바꿔 성능 동인을 가리기 어렵다는 문제에, 6개 알고리즘 도메인에 걸친 통일된 실험 파이프라인으로 개별 ablation을 수행. 중간 길이 그래디언트 호라이즌·큰 물리적 배치·제어된 순환 상태 갱신이 안정적 일반화의 핵심이고 명시적 계층 구조는 불필요함을 발견, 이를 결합한 1,360만 파라미터 모델이 Arithmetic OOD 정확도를 기존 최강 베이스라인 36.2%→71.2%로, Sudoku 98.41%, ARC-AGI-1 pass@2 59.5%로 끌어올림.
- Learning Steganography Is Easy, Learning Steganographic Reasoning Is Hard (2609.39838) — CoT 모니터링 기반 AI 감독이 LLM이 추론을 무해해 보이는 텍스트 속에 숨기는 steganographic reasoning에 취약할 수 있다는 우려에, RL·in-context learning·SFT 세 유도 방식에서 steganographic reasoning과 이웃한 두 능력(은닉 메시지 전달, 비은닉 암호화 추론)의 학습 난이도를 비교. 대부분 과제에서 steganographic reasoning은 SFT로만 학습되고 메시지 전달보다 최소 2배 훈련이 필요하며 일부 모델-과제 조합에서는 전혀 학습되지 않았으나, 정보 은닉이 특히 용이한 커버 과제에서는 세 방식 모두에서 학습 가능 — 어제 브리핑의 "Hidden Reasoning Must Leak" 논문과 같은 CoT 모니터링 한계 주제를 실증 측면에서 보완.
Paper Radar 채택1보류3탈락7
조회 800건 · 신규 694건 · 채택 1 · 보류 3 · 탈락 7
색인 상태: newest_fetched 2026-09-30T17:59:56Z — 직전 커서(2026-09-29T17:59:55Z)에서 하루 전진했다. 실행 시각(2026-10-01 22:40 UTC)보다는 여전히 약 28.7시간 뒤처져 있어 지연이 계속된다. 6절 규칙에 따라 wall-clock이 아닌 관측된 가장 최신 published(2026-09-30T17:59:56Z) 를 다음 --last-run 커서로 쓴다 — 10-01 이후 투고분은 아직 후보에 오르지 못했으므로 색인이 따라잡히는 대로 다음 실행에서 정상적으로 올라올 것이다.
신규 694건 중 radar_match 11건만 Gate A/B로 넘겼다.
채택
- ConflictGuide — AutoResearch Improves When Competing Behaviors Are Made Visible
- arXiv: 2609.39933
- 통과 근거: Gate B-1 — 스칼라 태스크 지표만 보는 AutoResearch 루프가 ML 전반에 흔한 "경쟁 행동"(한쪽 개선이 다른 쪽을 악화시키는 트레이드오프)을 전혀 보지 못한다는, 코퍼스가 아직 다루지 않은 보상 신호 설계 축을 열었고 5개 이질적 모델군·4개 코딩 에이전트에서 정량 재현(태스크 오류 최대 28%↓·충돌 오류 최대 14%↓).
- 파일:
2026/2026_ConflictGuide_Competing-Behavior-Feedback-AutoResearch_arXiv2609.39933.pdf· 리뷰:2026_ConflictGuide_Competing-Behavior-Feedback-AutoResearch_arXiv2609.39933_리뷰.md
보류
- AIM: Agentic Idea Management for Automated Research — 2609.38445 — Gate A(아이디어 중심 탐색 관리)는 통과하나, 코퍼스의
AIResearchPreferenceModels(실행 전 후보 가치 예측/acquisition)·PrimeScientist(분기 가치 기반 자원배분)와 같은 "실행 전 가치 추정으로 탐색을 이끈다"는 핵심 메커니즘을 공유해 새 문제 축인지 애매. - Experimental Experience Modeling for Autonomous Research (EEM) — 2609.39392 — Gate A는 통과하나, 코퍼스의
PrimeScientist(전략적 연구 노력 배분)·WastedCompute(컴퓨트 낭비 회수)와 같은 "실험 투자 결정" 축과 겹쳐 독립적 기여 강도가 애매. - RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models — 2609.39551 — Gate A는 통과하나, 코퍼스의
AutoResearchProd(프로덕션 규모 실패 유형)·ImplementationLottery(구현 신뢰도 감사)와 같은 "실행 정확도/신뢰도" 축과 겹치고 랭킹 모델이라는 좁은 응용 도메인에 묶여 새 축인지 애매.
탈락
- DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents — 2609.40306 — 핵심 기여가 로봇 물리 실행 거버넌스/능력 자기진화로, 과학적 가설 탐색이 아닌 로봇 제어 엔지니어링 응용이라 Gate A 미충족.
- RiboUnmix: Learning Shared Translational Dynamics from Biased and Noisy Ribo-seq Measurements — 2609.39644 — 핵심 기여가 리보솜 프로파일링 노이즈 분리를 위한 도메인 특화 통계 모델로, AI 에이전트 기반 연구/가설 생성 방법론이 아니라 Gate A 미충족(
radar_match는 "biological hypothesis generation" 문구의 우연 일치). - Autoresearch in Mixed-Integer Linear and Nonlinear Programming (AutoMIP) — 2609.39360 — 기존 idea-pooling+알고리즘 트리 탐색 autoresearch 방법을 MILP/MINLP 도메인에 갈아끼운 응용이라 Gate B 즉시 탈락 사유(도메인 갈아끼우기)에 해당.
- DAGent: Evaluate-then-Grow Planning for Deep Research Agents — 2609.39154 — 핵심 기여가 웹 기반 정보 탐색·질의응답(BrowseComp/GAIA) deep research 에이전트의 플래닝 개선으로, 과학적 가설 탐색/AI-Scientist 파이프라인이 아니라 Gate A 미충족.
- Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents — 2609.39026 — 핵심 기여가 인용 기반 리포트 작성 에이전트의 증거 선택 편향 감사로, 연구 아이디어/가설 평가가 아닌 일반 정보 종합 에이전트 감사라 Gate A 미충족.
- SimEX: Simulation-Integrated Robotics AutoResearch — 2609.38982 — 핵심 기여가 로봇 물리 능력 습득을 위한 시뮬레이션-실물 통합 엔지니어링으로, 과학적 발견 파이프라인이 아닌 로봇공학 응용이라 Gate A 미충족.
- Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts — 2609.38670 — 핵심 기여가 문헌 검색 에이전트의 노출/검토 행동 진단 프로토콜로, 연구 아이디어 품질/분포 평가가 아닌 검색 행동 감사라 Gate A 미충족.