기관 리서치
Google DeepMind
- 신규 없음. RSS 기준 최신 글은 2026-09-08 "AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome"(어제 브리핑에서 이미 다룸)로 갱신 없음.
Google Research
- 신규 없음. RSS 기준 최신 글은 2026-09-10 "ToolGrad: Efficient tool-use dataset generation with textual gradients"(어제 브리핑에서 이미 다룸)로 갱신 없음.
OpenAI
- 신규 없음 (RSS 카테고리 "Research"/"Publication" 기준). 09-14 이후 게시물은 여러 건 있으나 전부 Product/Company/Startup/Engineering/Global Affairs/Applied AI 카테고리이며, Research·Publication 카테고리의 최신 글은 여전히 2026-09-08 "On the Navier–Stokes Millennium Prize Problem"(어제 이미 다룸).
Anthropic
- 신규 없음. https://www.anthropic.com/research 기준 최신 글은 2026-09-10 "Measuring tactical intelligence targeting and conventional weapons capabilities of AI models"로, 09-14 이전 게시물.
- (참고) 이 글의 핵심 수치: 사진 지오로케이션에서 Frontier Red Team 평가 모델이 플리커 이미지 6,000장 기준 중간값 오차 37km로 오픈웨이트 모델(385km) 대비 크게 우수했고, 정지 표적 명중률은 80%(vs. 5%)였으나 적대적 시나리오에서는 전 모델 성능이 붕괴 — 이 항목은 09-14 브리핑에서 상세히 다뤘으므로 여기서는 갱신 없음으로만 기록.
Meta FAIR / Meta AI
- 신규 없음. https://ai.meta.com/blog/ 기준 노출되는 최신 글은 여전히 2026-07-27 "Reimagining Independence..."로, 9월 게시물은 페이지 목록에 확인되지 않음(목록이 최신화되지 않았을 가능성에 유의).
Microsoft Research
- 신규 없음. RSS 기준 최신 글은 2026-08-31 "GigaPath-Flash and GigaTIME-Flash"로 커버 범위 이전.
NVIDIA Research
- CUDA-Q Logical: Retargetable Compilation for Fault Tolerant Quantum Computing (2026-09-14, 개별 발행 페이지에서 날짜 확인) — 논리적 양자 프로그램을 결함허용 양자컴퓨팅(FTQC) 구현으로 변환하는 컴파일러 인프라. 고수준 코드를 양자 오류정정 마이크로코드와 물리적 게이트 스케줄까지 단계적으로 낮추면서 의미 보존과 자원 사용량 추적을 함께 수행하며, 모든 자원 추정치를 컴파일러 산출물에서 직접 도출해 기존 해석적 모델이 놓치던 숨은 비용 요인을 드러낸다. — 링크
- 관련 주제: 해당 없음 (양자컴퓨팅 컴파일러로 5개 핵심 주제와 직접 관련 없음)
Apple ML Research
- 신규 없음. RSS 기준 최신 글은 2026-09-11 "DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation"(어제 브리핑에서 이미 다룸)로 갱신 없음.
arXiv 신규
AI Agents
- Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering (2609.12039) — 에이전틱 소프트웨어 엔지니어링의 실패를 "요구사항 갭"(요구사항이 이해관계자 의도를 근사할 뿐)과 "모델 갭"(평가 모델이 실배포 환경을 근사할 뿐)으로 통합해 설명하는 포지션 논문. reward hacking은 이 갭의 허점을 파고들고 hallucination은 갭을 더 벌린다고 프레이밍하며, 갭을 "닫는 것"이 아니라 배포 증거로 계속 "좁히는" assurance-revision 루프를 제안한다.
- ParaRecover: A Process-Level Benchmark for Error Localization and Recovery in Parallel Tool-Use Agents (2609.12345) — 최종 성공률만 보는 기존 벤치마크와 달리, 병렬 도구 호출에서 발생하는 14종 오류 유형(계획 의존성·도구 선택·인자 매칭)에 대한 중간 실패 진단·복구 능력을 1만여 개 인스턴스로 측정. 10개 이상 최신 LLM이 다중 턴 오류 전파와 암묵적 도구 실패에 여전히 취약함을 보였다.
- BlueLM-GUI Technical Report (2609.12394) — 샌드박스-실배포 분포 불일치, 실기기 실패 데이터 낭비, 벤치마크 포화라는 세 가지 산업 배포 문제를 겨냥한 35B-A3B 모바일 GUI 에이전트. 실제 수백 대 실기기에서의 지속 사전학습·SFT·에이전틱 RL로 훈련해 MobileGUI-VBench 87.4점(최고 클로즈드소스 대비 +5.1점), AndroidWorld에서 오픈소스 중 최고 성능을 달성.
AI Scientist / Automated Research
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement (2609.11873) — Headroom-Closed Index(HCI)로 현재 LLM의 한계를 드러낸 뒤, 재귀적 자기개선(RSI)을 개선-실행 자율성→개선-전략 자율성→경험-획득 자율성→환경-적응 자율성→재귀적 메타개선의 로드맵으로 분해하는 포지션 논문. 과학적 발견·체화 지능·SW 엔지니어링 등 시나리오별 요구사항과 개발 속도 차이를 짚는다.
- LLM-Guided Program Evolution for Circle Packing: Breaking 10 Packomania Records for $28 (2609.05093) — LLM이 시드 솔버에서 출발해 스코어보드와 과거 아이디어 이력을 보고 알고리즘 개선을 반복 제안하고 독립 검증기로 채택 여부를 가르는 경량 시스템 Discovery Loop. Packomania 원 채우기 벤치마크의 N=101–114 구간에서 10개 기존 최고 기록을 2.4–5.4% 갱신했고 총 LLM 비용은 27.72달러(15회 반복 이내) — 자동화된 과학적 발견의 접근성을 구체적 수치로 보여준 사례.
- La Agente Óptima: Towards Agentic Self-Driving Laboratories (2609.04564) — LLM 추론과 실행 중인 베이지안 최적화 캠페인을 분리해, 진행이 해석·수정을 요할 때만 에이전트가 개입하는 self-driving lab 프레임워크. 5일짜리 다목표 유동화학 캠페인에서 수율을 30%→59%(23회 실험)로 끌어올렸고, 접촉각 최적화 중 측정 실패를 스스로 감지·보정해 "현재 시약으로는 목표 도달 불가능"까지 올바르게 추론했다.
- Autonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval (2609.13073) — 기존 자율연구 프레임워크가 언어모델링·생의학처럼 탐색공간이 좁은 문제에만 성공적이었다는 문제의식으로, 통신 티켓 검색이라는 산업 규모의 개방형(open-ended) 문제에 적용. 최소한의 인간 감독으로 SOTA의 90%(Recall@1 0.34 vs 0.38)를 10주 만에(인간 10개월 대비) 캠페인당 최대 200달러로 달성했지만, 인간 같은 직관·창의성 부족과 운영 오버헤드라는 한계도 함께 보고한다.
Hypothesis Generation
- HypoKG: Evidence-Disciplined Biomedical Hypothesis Generation Beyond Endpoint Knowledge (2609.12260) — KEGG·Rhea·UniProt를 통합한 생화학 지식그래프로 효소-희귀질환 550개 경로, 13,200개 가설을 생성시켜 LLM이 실제로 경로 구조에 근거해 추론하는지 검증. 경로의 중간 단계를 섞으면 근거성 점수가 유의하게 하락함을 보여(p<0.001) 모델이 실제로 경로 정보를 사용함을 확인했지만, 출발점·도착점만 준 조건이 오히려 더 그럴듯하면서 덜 근거 있는 가설을 만든다는 점도 발견.
- Biology-in-the-loop: Amortized Adaptive Hit Discovery in CRISPR Screens (2609.11877) — 제한된 예산 하 순차적 실험 선택이 필요한 CRISPR 스크리닝을 위해, 1,389개 스크린으로 구성된 대규모 벤치마크(AssayBench-Loop)와 과거 실험들로 학습한 트랜스포머 기반 획득 정책(AssayFormer) + LLM 사전지식을 결합한 프레임워크(AssayLoop)를 제안. 시간 기준으로 분리된 검증 세트에서 무작위 대비 5.67배 농축, 후보 라이브러리의 약 5%만 평가하고도 히트의 27.7%를 회수.
Long-context
- FlexComp: One Model for Every Ratio in Context Compression (2609.11192) — 기존 소프트 컨텍스트 압축기는 압축률을 학습·배포 시 고정해야 했던 것과 달리, Matryoshka 스타일 학습으로 하나의 모델이 모든 압축률을 지원하고 입력별로 신뢰도 기반 캐스케이드 라우팅이나 경량 예측기로 압축률을 그때그때 고르게 함. 최대 266배 압축에서 정확도의 98% 이상을 유지하며, 서빙 배치 규모에서 KV 캐시를 50% 줄이고 디코딩 처리량을 47% 개선.
- The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination (2609.12111) — 사실 환각을 "모델이 사실을 아예 못 봤다"는 커버리지 문제로만 보는 통념에 맞서, 유한한 메모리가 관측된 사실조차 손실 압축해 저장할 수밖에 없다는 두 번째 오류 원인을 정보이론적으로 정식화. 관측 사실 대비 압축 왜곡 항과 미관측 사실의 커버리지 부족 항을 분리하는 하한을 증명하고, 실제 언어모델에서의 fact-injection 실험으로 이 신호를 확인.
- ConvMem: Convolutional Memory for Long-Context Reasoning (2609.10441) — MemAgent류의 순차적 메모리 갱신이 겪는 고지연·고비용 RL 학습 문제를 피하기 위해, LLM을 CNN의 커널처럼 취급해 텍스트를 계층적으로 요약하는 학습-불필요(training-free) 프레임워크. 추론 경로를 선형 체인에서 로그 트리로 단축하고 세그먼트·추론 스레드 양쪽에서 대규모 병렬화가 가능하며, RULER-HotpotQA/2WikiMultiHopQA에서 학습-불필요 베이스라인을 능가.
Reasoning
- Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning (2609.11393) — "고신뢰도=정답"이 아니라 "국소 섭동에도 신뢰도가 안정적일 때 더 정답에 가깝다"는 관찰에서, LLM을 고정한 채 경량 프리픽스만 최적화해 신뢰도의 지역적 안정성을 높이는 테스트타임 적응 기법(TASCO)을 제안. 다양한 LLM·추론 벤치마크에서 정확도와 토큰 효율을 함께 개선.
- Beyond Solver Verdicts: Generative Reward Models for Autoformalization (2609.11085) — 뉴로심볼릭 시스템의 형식화 검증이 "솔버가 맞다고 하면 맞다"는 판정만 보고 실제 원문과의 참조 동등성은 못 보는 취약점(Verdict-Preserving-Unfaithfulness)을 정식화하고 이론적으로 그 탐지 한계를 증명. Z3 동치성 오라클을 증류한 생성형 검증기(GenV)로 참조 동등성 점수를 직접 얻어 AUROC 0.961, 보지 못한 번역기에도 제로샷 일반화, 에이전틱 테스트타임 연산 배분에서 11.3점 향상.
- GraphAHA: Graph-Based Adaptive Search with Heterogeneous Actions for Test-Time Code Generation (2609.12757) — 트리 기반 테스트타임 코드 생성 탐색이 같은 프로그램으로 수렴하는 궤적도 별개 상태로 중복 평가하는 문제와, 샘플링·수정·추론이라는 이질적 행동 간 온라인 예산 배분 문제를 그래프 구조(동일 프로그램을 한 노드로 병합) + 계층적 톰슨 샘플링으로 함께 해결. LiveCodeBench·CodeContests 20개 설정 중 18개에서 최고 점수, Pass@1 평균 4.1%p 개선.
Paper Radar 채택2보류3탈락9
조회 14건 · 신규 14건 · 채택 2 · 보류 3 · 탈락 9
색인 지연 참고: --wide 조회 결과 중 가장 최신 published는 2026-09-11T17:59:07Z로, 실행 시각(2026-09-15 KST)보다 약 4일 뒤처져 있다. covered: true였고(2,200건 조회, 새 기준 상한 max_candidates_fetched를 2000→2600으로 상향해 재실행 후 도달), 신규 2,158건 중 topics.toml 키워드가 걸린 14건만 Gate A/B로 넘겼다. 커서(last_run)는 6절 규칙에 따라 "지금"이 아니라 이번에 실제로 관측된 최신 published 시각(2026-09-11T17:59:07+00:00)으로 설정한다 — 09-12~09-15 게재분이 아직 API에 완전히 반영되지 않았을 수 있으므로, 그 구간이 다음 실행에서 다시 후보에 오르도록 남겨둔다.
채택
- OSR (Online Surrogate Repair) — Decoupling High-Fidelity Feedback from Search Length in Closed-Loop Discovery
- arXiv: 2609.07655
- 통과 근거: Gate B-2 — 재현 파이프라인에 바로 투입 가능한 방법. 희소한 고정밀 오라클 쿼리를 탐색 도중 온라인으로 배분하는 acquisition(Online EI)이 동일 예산에서 정적 보정 대비 44% 낮은 후회, MADE 벤치마크에서 완전 피드백 대비 6.36–10.27배 적은 오라클 쿼리로 같은 발견 수 도달(Table 2, 3) — 검증 비용이 비싼 closed-loop 시스템 전반에 적용 가능한 정량적으로 강한 결과.
- 파일:
2026/2026_OSR_Online-Surrogate-Repair-Closed-Loop-Discovery_arXiv2609.07655.pdf· 리뷰:..._리뷰.md
- DCP (Discovery Certification Protocol) — Scores Alone Do Not Prove Discovery: Auditing AI Research Agents
- arXiv: 2609.09219
- 통과 근거: Gate B-1 — "점수가 높다"는 단일 보고를 유용성/회복 불가능성/피드백 인과효과라는 세 개의 독립적으로 실행 가능한 사전등록 감사로 분해하는 새 문제 축을 염. 지식포장(knapsack) 케이스로 회복 규칙이 실제 발동함을 시연하고, 두 도메인 완전 감사(0/96 회복, p_upper=0.0468)로 프로토콜 전체가 동작함을 검증(Table 2, Fig. 2–4) — 기존 코퍼스의 정성적 position paper(Adversarial Experiments)·벤치마크(SciIntegrity-Bench)와 달리 실행 가능한 통계적 인증 절차.
- 파일:
2026/2026_DCP_Discovery-Certification-Protocol_arXiv2609.09219.pdf· 리뷰:..._리뷰.md
보류
- HypoKG — Evidence-Disciplined Biomedical Hypothesis Generation Beyond Endpoint Knowledge — 2609.12260 — Gate A/B 자체는 통과(경로 셔플 대조로 근거 사용을 직접 검증하는 Gate B-1급 발견)하나, 생의학 단일 도메인에 국한되고 일일 채택 상한(2편)에서 OSR·DCP보다 재현 파이프라인 적용 범위가 좁아 순위에서 밀림.
- AgentIdeaBench — Benchmarking Scientific Ideation in the Agent Era — 2609.07611 — 정적 관찰 대비 능동 탐색 설정을 매칭 비교해 "정적 이디에이션 벤치마크는 모델이 강해질수록 변별력을 잃는다"는 주장은 Gate B-3급이나, 코퍼스에 이미 유사한 능동/정적 이디에이션 평가(TasteGap, LigBench, HypoExplore)가 다수 있어 신규성 강도가 OSR·DCP에 못 미침.
- AutoKD — Autonomous Knowledge Discovery — 2609.06366 — 누적되는 insight graph로 발견을 축적·재활용한다는 주장이 코퍼스의 기존 프레임워크(Arbor의 hypothesis-tree refinement, AutoScientists의 장기 실행 자기조직화, ATLAS의 active theory learning)와 실질적으로 얼마나 다른지 애매해 Gate B 충족을 보류.
탈락
- Mr.LHDR — Multimodal Real-World Long-Horizon Deep Research Agents 벤치마크 — 2609.11318 — Gate A 탈락: 핵심 기여가 웹 리서치/증거 종합 에이전트 벤치마크로, 자율 연구 파이프라인(아이디어→실험→논문 closed loop)이 아니라 LLM/에이전트를 도구로 쓰는 응용 벤치마크에 가까움.
- Sci-MMR — Multi-Step Evidence-Grounded Scientific Reasoning in Multimodal Agents 벤치마크 — 2609.11243 — 코퍼스의 기존 trace-audit 논문들(OpenDiscoveryTrace, No-ScientificReasoning, ABE-Ralph)과 문제의식이 크게 겹쳐 Gate B 미충족.
- Auto-RecSys — 산업 규모 추천 시스템을 위한 자율 연구 에이전트 — 2609.10922 — Gate B 평가 없이 즉시 탈락: 기존 자율연구 패러다임을 추천시스템 도메인에 적용한 도메인 갈아끼우기 성격.
- RAP — Research Attention Prediction — 2609.10092 — Gate A 탈락: 핵심 기여가 연구 분야별 논문 점유율(트렌드) 예측이라는 메타 예측 과제로, 가설 생성·탐색이나 연구 아이디어 자체의 평가가 아님.
- AgentAudit — AI 에이전트 전체 생애주기 신뢰성 평가 프레임워크 — 2609.09875 — Gate A 탈락: 계획·도구사용·메모리·정렬 등을 포괄하는 일반 AI 에이전트 신뢰성 벤치마크로, 자율 연구/가설 생성/아이디어 평가라는 3대 주제 어디에도 핵심 기여가 해당하지 않음.
- A-MLE — 광고 랭킹을 위한 Agentic ML Exploration — 2609.08248 — Gate B 평가 없이 즉시 탈락: Auto-RecSys와 동일한 성격의 도메인 갈아끼우기(광고 랭킹).
- OpenDiscoveryTrace — AI 사이언티스트 워크플로우 프로세스 트레이스 데이터셋 — 2609.09203 — 코퍼스의 기존 trace-audit·실패 진단 논문들과 겹쳐 Gate B 미충족.
- AuditForecast — 구조화된 에이전틱 예보(forecasting) 스캐폴드 — 2609.05905 — Gate A 탈락: 핵심 기여가 일반 미래사건 예보 에이전트로, 과학적 가설 생성·검증이 아님.
- DCFA — LLM 멀티에이전트 시스템의 실패 원인 규명(Dual-view Causal-inspired Attribution) — 2609.04749 — 일반 멀티에이전트 시스템 실패 진단이라는 범위가 자율 연구 파이프라인에 특정되지 않고, 코퍼스의 SAGE(Multi-Hypothesis Failure Attribution)와 문제의식이 겹쳐 Gate B 미충족.