기관 리서치
Google DeepMind
- 신규 없음 (RSS 최신 글은 "Introducing Gemini 3.7 Flash", 2026-08-13 — 커버 범위 이전)
Google Research
- 신규 없음 (직전 브리핑에서 이미 다룬 "Seeing beyond BMI" 이후 새 글 없음)
OpenAI
- 신규 없음 (Research/Publication 카테고리 기준. 8/17~8/18 RSS에 7건이 새로 올라왔으나 전부 Global Affairs/Company/Product/Security 카테고리)
Anthropic
- How Claude is accelerating protein design and analytical chemistry — Anthropic이 두 실험 결과를 공개. (1) Claude(Mythos Preview + Opus 4.8)가 15개 표적에 대해 단백질 바인더를 자율 설계했고 Adaptyv Bio·Twist Bioscience의 습식 검증에서 성공률 22~35%를 기록(업계 표준 10~15% 대비 우수). (2) Claude Opus 5가 NMR·LC-MS 원시 계측 파일(비공개 바이너리 포맷 포함)을 직접 해독해 화합물 동정·순도 분석을 약 25분 만에 완료(기존 30~60분+수일 대비 단축). — 링크
- 관련 주제: AI Scientist / Automated Research
Meta FAIR / Meta AI
- 신규 없음 (최신 글 7/27 그대로)
Microsoft Research
- 신규 없음 (최신 글은 "MindTopo Reveals VLMs' Spatial Reasoning Abilities", 8/12)
NVIDIA Research
- ⚠ 확인 실패 — research.nvidia.com/publications는 게시물별 날짜가 없어 신규 여부 판별 불가. 대체 경로 blogs.nvidia.com/feed/의 8/14·8/17 항목은 인프라 파트너십/대학 협력 발표로 연구 콘텐츠가 아니라 제외.
Apple ML Research
- GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings — 검증 가능한 보상 기반 RL(RLVR)을 다국어 환경에서 대규모로 실증. 모국어로 추론하도록 학습해도 영어 학습 대비 성능 격차가 크지 않았고, 한 언어로 학습한 추론 능력이 다른 언어로 전이되는 효과를 관찰했으나 모델·언어 조합에 따라 도메인 외 성능이 크게 저하되는 경우도 확인. 대부분의 RLVR 연구가 영어에 집중된 상황에서 다국어 일반화의 이점과 한계를 함께 보임. — 링크
- 관련 주제: Reasoning
arXiv 신규
색인 지연 참고: 넓은 조회(627건, covered: true)의 최신 게재가 2026-08-17T17:59:57Z로, 실행 시각(2026-08-18T22:46Z) 대비 약 1.2일 지연. 커버 범위 종료 시각(8/17 22:38Z) 이후 새로 관측된 항목은 0건이었음 — 즉 이번 창에서 arXiv 색인이 실제로 전진한 폭이 매우 좁았다는 뜻으로, "신규 없음"이 아니라 색인 지연의 결과. 아래 15건은 직전 브리핑(8/18, 최대 arXiv2608.14407까지 커버) 이후 색인에 새로 잡힌 항목 중에서 선별.
AI Agents
- Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory (2608.16889) — VLA 모델에 LLM 에이전트를 얹어 장기 로봇 조작을 체인화하는 구조에서, 전체 과제 단위 탐색 비용이 단계 수에 곱셈적으로 커지고 한 서브태스크의 부작용이 다음 단계를 암묵적으로 제약하는 두 가지 실패 모드를 지적하고 이를 완화하는 전이 인지 메모리 구조를 제안.
- When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding (2608.16801) — 멀티에이전트 코딩 팀의 협업을 에이전트·파일을 노드로, 메시지·읽기·쓰기를 시간표시 엣지로 하는 시간적 네트워크로 정량화. 1,902회 실행에 팀 크기·구조·파일 정책을 바꿔가며 적용해 기존 "완료 여부·비용" 중심 평가가 놓치던 협업 구조 자체를 계측.
- The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks (2608.16630) — 저장소 규모 코딩을 "결합된 사실 그래프 재구성"으로 모델링해, 필요한 사실이 컨텍스트에도 파라메트릭 기억에도 없는 상태를 "coherence debt"로 정의. 7개 모델·5개 하네스에서 두 채널을 통제·오염시켜 실험한 결과, 실제 라이브러리의 rename이 모델의 기억과 충돌하면 7개 모델 전부가 같은 지점에서 동일하게 실패.
AI Scientist / Automated Research
- Personalized Auto-Research: Towards a True AI Co-Scientist (2608.14881) — 현재 AI 공동연구자 시스템은 목표만 주어지면 연구자와 무관하게 동일한 결과를 낸다는 "researcher-agnostic" 한계를 지적하고, 그래프 기반 연구자 표현을 검색·가설탐색·실험·집필·리뷰 전 단계에 관통시키는 "personalized auto-research" 문제를 정식화. 동일 목표를 낸 서로 다른 연구자가 사실상 같은 결과를 받는 one-size-fits-all 실패 모드를 핵심 논거로 제시.
- Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search (2608.15669) — 생성모델(제안·정제)과 베이지안 비모수 서로게이트 보상모델(불확실성 정량화)을 결합해 분자·단백질·프로그램 같은 개방형 가설 공간을 탐색하는 LDM을 제안. 신경망 학습·항체 설계·분자 최적화 3개 시나리오에서 LLM-only reflection·전통 통계적 탐색 대비 검증 BPB 2.4배 개선, 결합에너지 18.2% 상대 개선, 다목적 분자 최적화 60%+ 상대 이득.
Hypothesis Generation
- Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies (2608.16645) — 원 논문과 이후·동시대 문헌을 모두 가린 채 발표 전 참고문헌 목록만 주고 진짜 연구 아이디어를 복원시키는 blind benchmark. 6개 과학 도메인 643편에서 프론티어 모델 7종의 단독 성능은 Match rate 3~15%에 불과했으나, 참고문헌만으로 교차 모델 리뷰 + 스위스 토너먼트를 도는 4-에이전트 파이프라인은 23~42%로 약 2.4배 상승.
- AutoSR: Automatic Symbolic Regression by Searching Research States (2608.16876) — 기존 기호회귀가 최종 수식·점수만 남기고 "왜 그 식을 시도했는가"라는 과학적 기록을 버린다는 문제를 지적, 각 후보 수식에 추론·계산적 증거·독립 리뷰를 결합한 "Research State"를 PW-MCTS로 탐색하는 AutoSR을 제안. 두 벤치마크 9개 과제 전부에서 대수적으로 동치인 관계를 복원, 기존 어떤 시스템도 못 푼 cp3-bench 3문제 포함.
Long-context
- Proteus: Incremental Memory Activation for Long-Context Sequence Modeling (2608.16844) — 기존 메모리 기반 장문맥 모델이 시퀀스 전체에 정적 메모리를 노출해 초반 토큰이 압축 압력 없이 메모리 용량을 과점("오염")하는 문제를 지적, 컨텍스트가 길어질수록 메모리의 유효 용량을 점진적으로 확장하는 incremental memory activation 패러다임을 제안.
- Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement (2608.16628) — 전통적 그래프의 이진 연결성이 차트·산재된 텍스트 설명·수치 데이터 사이의 N항 관계 같은 고차 상관을 못 담는다는 한계를 지적, 하이퍼그래프 기반 M-RAG(Hyper-M2RAG)로 전체 페이지 재구성 없이 증분적으로 정제.
- Cost Scales with Change, Not Corpus Size: Incrementally Maintaining an Evolving Semantic Substrate (2608.16621) — RAG/에이전트 QA가 매 질의마다 코퍼스 의미를 다시 유도하는 대신, 문서 도착 시점에 한 번 컴파일한 "의미 substrate"를 유지·갱신하는 방식을 제안. 변경마다 전체 SVD를 재계산해야 한다는 통념에 맞서 비용이 코퍼스 크기가 아니라 변경량에 비례함을 실증.
Reasoning
- GRIP: Grounded Reasoning via Information-Restricted Premises (2608.16776) — RAG에서 고용량 인코더가 질의(query)에 잠재상태를 지배당해 검색된 근거가 사실상 무의미해지는 "query dominance"를 지적. 디코더는 질의에 전체 접근을 유지하되 검색 증거는 강한 확률적 병목을 통과시켜 질의로 설명 안 되는 잔여 정보만 인코딩하도록 강제, 5개 추론 벤치마크에서 반복 정제 baseline 대비 우수.
- TDD-Agent: Test-Driven Reasoning for Code Generation (2608.16742) — 생성된 테스트를 사후 정적 검증기로만 쓰는 기존 방식의 한계(테스트 자체가 불완전하면 오도)를 지적, 구현 전에 먼저 실행 가능한 테스트를 생성해 기대 동작을 명확히 하고 이후 테스트·구현을 반복적으로 이중 트랙 정제하는 TDD-Agent를 제안.
- CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs (2608.14791) — "최선의 설명으로의 추론"인 abductive reasoning이 좁은 태스크별 벤치마크로만 연구돼 전이 여부가 불분명하다는 문제의식에서, 최종 정답 정확도에 증거 커버리지·증거→설명 방향성 보상을 결합한 process-aware RL(CEDAR-GRPO)을 제안, 4개 오픈웨이트 모델을 도메인 중립 혼합 과제로 post-training해 11개 미학습 과제에서 평가.
- PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data (2608.16419) — 세포 섭동 아틀라스를 RL 환경으로 바꿔, 측정된 유전자 반응을 계산 가능한 보상으로 사용. 순방향 섭동-반응 예측만으로 학습했음에도 역방향 섭동 식별·이중 섭동 추론·표현형 스크리닝 우선순위화·생물학적 과정 해석 등으로 태스크별 추가 학습 없이 전이됨을 관찰.
Paper Radar 채택1보류0탈락3
조회 800건 · 신규 627건 · 채택 1 · 보류 0 · 탈락 3
색인 상태: 넓은 조회(800건, covered: true)의 최신 게재가 2026-08-17T17:59:57Z(2608.16889)로, 직전 커서(2026-08-14T17:51:30Z)에서 사흘치가 새로 열렸습니다. 다만 실행 시각(2026-08-18T22:46Z) 대비 여전히 약 1.2일 지연이므로, 6절 커서 규칙에 따라 last_run을 실행 시각이 아니라 이번에 실제로 관측된 최신 게재 시각(2026-08-17T17:59:57+00:00)으로 전진시킵니다. 레이더 좁은 관문 후보는 4건(radar_match)이었습니다.
채택
- AutoResearchEval / ARFT — How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
- arXiv: 2608.14905
- 통과 근거: Gate A-3(자동연구 벤치마크·아이디어 평가) + Gate B-1/B-4 — 종점 채점이 아니라 프로세스·아티팩트 수준에서 실패를 진단하는 새 문제 축(45패턴 ARFT)을 열었고, 100과제·7도메인·800궤적 규모로 이 분야의 표준이 될 만한 벤치마크·데이터셋(공개)을 제공. 8개 harness-model 조합 공통 원인(메타인지 루프 부재)까지 규명해 재현 파이프라인 진단 도구로 바로 투입 가능.
- 파일:
2026/2026_AutoResearchEval_Diagnostic-Failure-Evaluation-for-Research-Agents_arXiv2608.14905.pdf· 리뷰:..._리뷰.md
보류
- 없음
탈락
- Towards Risk-free AI Agent Deployment — 2608.16411 — Gate A 탈락: 핵심 기여가 일반 에이전트 배포 리스크(보안·컴플라이언스) 테스팅/디버깅 방향 제시로, 자율 연구 파이프라인·가설 생성·아이디어 평가 어디에도 해당하지 않음. 정량 평가 없는 포지션 페이퍼라 이중으로 자동탈락.
- BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics — 2608.16211 — Gate A 애매/탈락: 핵심 기여가 커리큘럼 RL 포스트트레이닝 방법(BiCuRL)이고 의료영상이라는 특정 응용 도메인에 갈아끼운 사례(AutoMedBench-Lite 단일 벤치마크) — "도메인 갈아끼우기" 자동탈락 기준에 해당, 일반 연구 자동화 파이프라인의 새 축이라 보기 어려움.
- Andy: A Mathematical Agent for Rigorous Proof and Autonomous Research — 2608.15052 — Gate A는 통과(자율 수학 연구 에이전트)하나 Gate B 이전에 자동탈락: 하나의 제어이론 사례(self-triggered impulsive consensus)로만 워크플로우를 예시하는 정량 평가 없는 데모 — 벤치마크·비교 없이 단일 case study.
번역본 안내
0-papers/_log/2026-08-19.en.md, 0-papers/_log/2026-08-19.es.md 참고.