기관 리서치
Google DeepMind
- From Atari to EVE Online: Building on 15 Years of AI Research in Games — DeepMind가 15년간 게임을 AI 연구의 시험대로 써온 역사(DQN의 Atari 49종 정복(2015)→AlphaGo(2016)→AlphaZero→AlphaStar(2019)→SIMA 2)를 되짚고, EVE Online 개발사 Fenris Creations와 새 연구 파트너십을 발표. EVE Online(20년 된 플레이어 주도 경제를 가진 MMO)·EVE Vanguard(1인칭 전술)·EVE Frontier(프로그래밍 가능한 개방형 세계) 세 환경에서 지속적으로 진화하는 세계 속 에이전트의 연속 학습·장기 지평 계획·복잡한 다중 에이전트 상호작용·확장된 메모리를 시험한다고 밝힘. — 링크
- 관련 주제: AI Agents
Google Research
- An AI tool for prioritizing candidate biomarkers from wearable sensor data — 웨어러블 생체신호에서 임상적으로 의미 있는 바이오마커를 자동 발굴하는 멀티에이전트 시스템 "Biomarker Discovery Framework"를 공개. Scout·Critic·Defender·Mechanism 등 역할별 에이전트가 데이터 이해→가설 접지→반복 탐색→적대적 검증(11개 체크리스트로 과적합·교란·생리학적 타당성 스트레스 테스트)→심층 리서치 평가→보고서 생성의 6단계를 수행하며, 수치 분석은 결정론적 계산에 맡기고 가설 형성만 생성형 추론에 맡겨 통계적 엄밀성을 유지한다고 주장. 참가자 9,279명의 3개 코호트에서 정신건강 바이오마커 41개·대사 바이오마커 25개를 식별했고(수면 변동성-우울 심각도 상관, 심폐 체력 지수의 인슐린 저항성 예측 등), 전문가 평가에서 통계적 타당성이 가장 높게 채점되었으며 생성 콘텐츠 채택률이 56.9%로 경쟁 시스템(18.8~30.4%)을 크게 앞섬. — 링크
- 관련 주제: AI Agents, Hypothesis Generation
- How mobility gives language models a deeper understanding of place — 장소에 대한 언어모델 표현을 정적 텍스트 메타데이터가 아니라 공개 이동성(mobility) 패턴으로 보강하는 프레임워크 ME-POIs(Mobility-Embedded POIs)를 제안. 방문 정렬(도착·출발·체류시간 추출)→공간 다중스케일 전파(혼잡한 인접 지역의 활동 패턴을 희소 지역으로 전이해 데이터 희소성 해결)→텍스트-이동성 시너지(언어 임베딩과 이동성 벡터를 정렬)의 3단계로 구성되며, 미확인 장소에서 방문 의도 예측 최대 81.9%, 가격대 분류 75.1%, 혼잡도 추정 24.7% 상대 개선을 보였고 이동성만 쓴 모델이 텍스트만 쓴 베이스라인을 앞서는 경우도 있었음. — 링크
- 관련 주제: 없음 (지리공간 표현학습 — 5개 arXiv 주제 밖이나 신규 게시물로 기록)
OpenAI
- 신규 없음 (RSS
openai.com/news/rss.xml확인. Research/Publication 카테고리 최신 글은 8/1 "Ten advances in mathematics"로, 커버 범위 이전)
Anthropic
- 신규 없음 (research 페이지 확인. 최신 글 "How Claude is accelerating protein design and analytical chemistry"(8/18)는 이전 브리핑에서 이미 다룸)
Meta FAIR / Meta AI
- 신규 없음 (블로그 페이지 확인. 최신 글 7/27 그대로, RSS 없음)
Microsoft Research
- 신규 없음 (RSS
/feed/확인. 최신 글 "Broadening access to Skala..."(8/20)는 어제 브리핑에서 이미 다룸)
NVIDIA Research
- ⚠ 확인 실패 —
research.nvidia.com/publications는 논문마다 학회 게재월만 표기돼("2026-12" 등 미래 날짜) 실제 게시일과 무관해 신규 판별 불가. 대체 경로blogs.nvidia.com/feed/도 게임/제품 소식 위주라 연구 신규 게시물 유무를 판별할 수 없음.
Apple ML Research
- Progressive Refinement: An Iterative Pseudo-Labeling Approach for Mandarin-English Code-Switching ASR (2026-08-20) — 문장 내에서 언어를 오가는 코드스위칭 음성인식(ASR)에 반복적 의사라벨링(iterative pseudo-labeling)을 처음 적용. 라벨 없는 데이터에서 의사라벨 생성→2단계 이중언어 모델 학습(사전학습+미세조정)→반복 정제의 3단계 프레임워크로 데이터 희소성 문제를 우회하며, SEAME 평가셋에서 devman 서브셋 6.35%, devsge 서브셋 8.29%의 Mix Error Rate 감소를 달성. — 링크
- 관련 주제: 없음 (코드스위칭 음성인식 — 5개 arXiv 주제 밖이나 신규 게시물로 기록)
arXiv 신규
색인 지연 참고: 넓은 조회(400건, covered: true)의 최신 게재가 2026-08-20T17:59:57Z로, 실행 시각(2026-08-21T22:43Z) 대비 약 1.2일 지연. "신규 228건"은 직전 브리핑 이후 색인에 새로 잡힌 항목 전체이며 그중 5개 주제 기준 15건을 선별. 레이더 좁은 관문(radar_match) 후보 2건은 모두 3절 Paper Radar에서 판정했으므로(3절 참고) 여기서는 중복 게재하지 않음.
AI Agents
- Inducing Task Models from Computer-Use Traces (2608.20319) — 화면 녹화·마우스/키보드 로그 같은 컴퓨터 사용 트레이스에서 얽혀 있는 여러 작업을 자동으로 분리하고, 목표 분해 구조와 실행 흐름을 함께 담은 '작업 모델'을 유도하는 TMI를 제안. 기존 방법이 단일 워크플로우를 가정하고 단계 요약만 만드는 것과 달리, TMI는 동시에 섞여 있는 작업들을 97.4%의 정확도로 분리하고 실행 단계의 74.9%를 복원하며, 이렇게 얻은 스킬은 held-out 과제 정확도를 최고 기준선 대비 30% 끌어올린다.
- Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents (2608.20274) — LLM 에이전트가 완료한 작업에서 스킬을 뽑아 재사용할 때, 스킬을 어떻게 유도하느냐에 따라 전이 성능이 크게 갈린다는 것을 통제된 실험으로 규명. 작업 단위 스킬은 대체로 무기억 기준선보다 성능을 떨어뜨리는 반면 하위작업 단위 스킬은 향상시키고, 텍스트 형식 스킬이 코드 형식보다 더 잘 전이됨을 발견했으며, 구체성·추상성을 결합한 '스킬 유용성 점수'로 사전 진단이 가능함을 보임.
- Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees (2608.19993) — 제한된 컨텍스트 창에 어떤 스킬 문서를 넣을지 고르는 문제를 토큰 예산 제약 하의 단조 서브모듈 최적화로 정식화하고, 다항시간 알고리즘 BPS를 제안하며 최초의 이론적 근사 보장(1-1/e, 1)을 제시. 오염 통제된 BigCodeBench 변형 실험에서 기존 스킬 라우터 대비 훨씬 적은 토큰으로 더 높은 작업 성공률(0.73 대 0.20~0.52)을 달성.
- Can Agent Memory Systems Track Evolving State? (2608.19652) — 기존 에이전트 메모리 벤치마크가 주로 '회상'만 측정하는 데 반해, 사실·제약·결정이 갱신되는 상황에서 최신 상태를 정확히 반영하는 '상태 추적' 능력을 새 벤치마크 StateMemBench로 정의·평가. 기존 검색증강·장문맥 기준선 모두 어려움을 겪는 반면, 상태의 대체·의존 관계를 명시적으로 추적하는 StateMem은 현재 상태 정확도를 기존 최고 대비 최대 1.8배 높였고 가벼운 래퍼로 기존 메모리 시스템에 적용 가능.
- EnvHarness: Awakening Static Worlds for Agent Learning (2608.19880) — LLM 에이전트 학습 환경이 대체로 수작업으로 고정돼 에이전트 약점에 맞춰 변하지 않는다는 문제를 지적하며, 환경 로직은 건드리지 않고 행동을 재구성하는 EnvHarness와 정책 궤적을 관찰해 결함을 진단·겨냥한 하네스 컴포넌트를 합성하는 EnvRigger를 제안. 네 도메인 다섯 벤치마크에서 기존 환경·도메인 특화 생성 파이프라인보다 최대 9.0점 높은 성능을 더 적은 실행 단계로 달성.
AI Scientist / Automated Research
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (2608.19799) — 과학 소프트웨어의 결함이 프로그램 동작뿐 아니라 과학적 결론의 근거 자체를 훼손할 수 있다는 문제의식에서, 98개 저장소·20개 과학 분야에서 뽑은 119개 과제로 구성된 레포지토리 단위 벤치마크를 제시. 최고 성능의 Claude Code(Opus-5, max)조차 pass@1이 50% 미만에 그쳤고, 과학 지식·추상화 부족, 피상적 탐색·수리, 통합 불완전, 일반화 실패라는 네 가지 반복적 실패 유형을 규명했으며, 잘 정제된 지식은 수리에 도움이 되지만 부정합한 지식은 오히려 방해함을 확인.
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis (2608.19902) — AI 에이전트가 과학 분석을 실행할 수는 있지만 대안 비교나 근거 범위 제한 없이는 방어 가능한 주장이 되지 못한다는 점을 지적하며, 허용 가능한 분석·필수 점검·주장 범위를 규정한 에이전트 연구 하네스 Brain Researcher를 제시. 7개 모델에 대해 첫 선택 도구 정확도를 23.3%→93.6%, 검증 가능한 근거 제시율을 4.6%→22.0%로 끌어올렸고, 다중우주 분석·과학적 검토로 주장을 수락/조건부/수정/차단/기각/보류로 분류하는 방법론적 판단을 워크플로우에 내장.
- Phantom Gains: Auditing Self-Improvement Against a Measured Null (2608.20290) — 언어모델의 '자기개선'을 문제별 정답/오답 전이로 판단하는 최근 흐름이 측정 오류에 취약하다는 것을 지적하며, 동결 대조군 없이 LoRA 자기학습 3라운드를 감사해 보고된 결과를 뒤집는 7가지 측정 실패를 발견. 다중 시행 대비 오탐률을 통제하는 문제별 정확 검정을 적용하면 외부 증류는 기저모델의 취약 문제를 개선하나 자기학습 방식은 그렇지 못하고 오히려 기존에 맞히던 문제를 훼손함을 보여, 자기개선 주장에는 별도로 측정된 널(null)이 필수임을 경고.
Hypothesis Generation
- Multi-Method Causal Evidence Synthesis: Ranking Candidate Drivers by Convergent Cross-Method Evidence from Observational Data (2608.20187) — 관측 데이터의 인과 추론에서 단일 방법 의존을 벗어나, 8개 수학적 전통에 속한 11가지 방법(비인과적 방법 포함)의 결과를 종합해 후보 원인 변수의 증거 수렴도를 정량화하는 프레임워크 MCES를 제안. 인과적 식별을 주장하는 대신 '가설 우선순위화'와 '아이디어 평가'를 지원하는 도구로, Sachs 단백질 신호전달 벤치마크 등에서 상위 5개 예측 정밀도 1.0을 달성.
- LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study (2608.19790) — 값비싼 실험/계산 평가가 필요한 소재 탐색에서, 별도 확률적 대리모델 없이 오픈웨이트 LLM 자체를 다음 실험 후보를 고르는 '획득 정책'으로 쓸 수 있는지 통제 실험으로 검증. 다섯 LLM을 네 소재 최적화 과제에 적용한 결과 무작위 선택보다 적은 반복으로 전역 최적점에 도달했지만 전통적 가우시안 프로세스 대비 과제별로 승패가 엇갈려, LLM 기반 실험 설계의 신뢰성 확보가 남은 과제임을 보임.
Long-context
- Learning how to Forget: Fine-tuning for Long-Context Sparse Attention (2608.19920) — KV 캐시 선택·압축을 통한 희소 어텐션 기반 장문맥 추론에서, 임의의 KV 캐시 정책에 대해 모델을 파인튜닝해 정책과 공동 적응시키는 방법을 제안. 단일 A100 같은 중간 규모 하드웨어에서 동작하며 종종 정밀 어텐션으로 학습한 모델보다 더 나은 성능을 내고, 대표 정책인 H2O 희소 어텐션의 효율적 커널 구현과 함께 오픈소스 라이브러리 KeysAndValues로 공개.
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving (2608.19758) — 장문맥 LLM 서빙의 프리필 단계 이차 복잡도 문제를 실배포 수준으로 해결. 평균 보정 항으로 극단적 희소성에서도 근사 오차를 억제하고 PackGQA·워프 특화·핑퐁 파이프라이닝·FP8 지원으로 FlashAttention-3/4와 정합시켰으며 페이지드 KV 캐시·연속 배칭 지원으로 SGLang 등에 바로 통합 가능. H20 GPU 128K 문맥 기준 FlashAttention-2 대비 FP8에서 최대 47.26배 속도 향상.
- Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization (2608.20281) — 추론 시점 검색 없이 고정 문서 집합에 대한 질문에 답하도록 문서 지식을 파라미터로 내재화하는 3단계 후처리 학습 프레임워크 IAR을 제안. 단순 계속 사전학습과 달리 문서를 이어쓰기·재작성·지시조건부 재구성 과제로 변환해 주입하고 QA 정렬 후 기반모델과 병합해 일반 능력을 복원하며, 여러 모델 계열에서 표준 SFT 대비 도메인 QA 정확도 3.6%p, 일반 성능 12.1%p 향상.
Reasoning
- Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation (2608.20256) — 고정 토큰 예산으로 추론하는 기존 모델과 달리, 응답 첫 토큰에서 NoThink·Short·Long 세 모드 중 하나를 스스로 선택하도록 GRPO 안에서 학습시켜 난이도에 따라 추론량을 조절. 1.5B 증류 모델을 MATH로 학습한 결과 세 모드가 붕괴 없이 분화했고 MATH500에서 기저모델과 비슷한 정확도(0.782 대 0.796)를 유지하면서 평균 응답 길이를 41% 줄였으며, 재학습 없이 GSM8K 등으로도 전이.
- FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models (2608.20153) — STOC·FOCS·SODA·COLT 2025-2026 논문에서 뽑은 175개 문제로, 논문 고유의 정의·가정·증명 의존관계를 보존하고 전문가 검증을 거친 Lean 형식화까지 포함한 최전선 이론전산학 연구 벤치마크를 제시. 최고 모델도 자연어 주장을 형식 정리 진술로 옮기는 자동형식화에서 11.5점에 그쳐(사람이 준 형식 진술을 증명하는 경우 28.6 Pass@8과 대비) 이 단계가 가장 날카로운 병목임을 밝혔고, 완전 자동화 파이프라인이 만든 64개 새 주장 중 전문가 평가·증명 검증을 모두 통과한 것은 6개뿐.
Paper Radar 채택0보류0탈락2
조회 400건 · 신규 228건 · 채택 0 · 보류 0 · 탈락 2
색인 상태: 넓은 조회(400건, covered: true)의 최신 게재가 2026-08-20T17:59:57Z(2608.20337)로, 직전 커서(2026-08-19T17:58:56Z)에서 하루치가 새로 열렸습니다. 실행 시각(2026-08-21T22:38Z) 대비 여전히 약 1.2일 지연이므로, 6절 커서 규칙에 따라 last_run을 실행 시각이 아니라 이번에 실제로 관측된 최신 게재 시각(2026-08-20T17:59:57+00:00)으로 전진시킵니다. 레이더 좁은 관문 후보는 2건(radar_match)이었습니다.
채택
없음
보류
없음
탈락
- Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale — 2608.19625 — Gate A 탈락: 핵심 기여가 과학 데이터셋을 에이전트가 쓰기 좋은 재사용 가능 스킬 형태로 패키징하는 표현·인프라이지, 자율연구 파이프라인·가설생성·아이디어평가 어느 것도 아니며 LLM/에이전트를 도구로 쓰는 응용 논문.
- Symposium: Trust via Auditable Records for Communities of AI Scientist Agents — 2608.19511 — Gate A 탈락: "AI Scientist Agents"를 다루지만 핵심 기여는 그 커뮤니티의 활동을 기록·감사하는 신뢰/출처 인프라 프레임워크이지, 아이디어→실험→논문의 closed-loop 파이프라인 자체나 가설 생성·탐색, 아이디어 평가·벤치마크가 아님.