Daily Update

바쁜 아침에 대신 읽어드리는 자율 연구 소식

리서치 레이더

2026년 8월 26일 (수) 기관 5 · arXiv 10 · 채택 1 · 보류 0 · 탈락 1

기관 리서치

Google DeepMind

  • 신규 없음 (최신 게시물은 8/21 "From Atari to EVE Online...")

Google Research

  • AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR — AR/VR에서 음성 지시만으로는 공간 맥락 전달이 어렵다는 문제에, LLM으로 발화와 동기화된 가상 손동작을 생성하는 AgentHands를 제안. 6차원 제스처 분류체계와 환경 인식·제스처 라이브러리·실시간 XR 실행을 통합했고, 12명 사용자 연구에서 음성 전용 대비 공간·행동 이해도와 안전 인지도가 유의하게 향상됨. — 링크
    • 관련 주제: AI Agents

OpenAI

  • 신규 없음 (Research/Publication 카테고리 기준, 최신은 8/1 "Ten advances in mathematics and theoretical computer science")

Anthropic

  • 신규 없음 (최신 게시물은 8/18 "How Claude is accelerating protein design and analytical chemistry")

Meta FAIR / Meta AI

  • 신규 없음 (최신 게시물은 7/27로, 8월 게시물 자체가 없음)

Microsoft Research

  • 신규 없음 (최신 게시물은 8/20 "Broadening access to Skala creates a faster path to predictive DFT")

NVIDIA Research

  • With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents — Groq 3 LPX 추론 가속기가 양산 단계에 들어가 Vera Rubin NVL72와 함께 에이전틱 워크로드를 지원한다는 소식. 10만 토큰 컨텍스트에서 초당 3,400 출력 토큰(경쟁 대비 4배)을 보고했고, Spectrum-X Multiplane으로 51.2만 GPU까지 확장 가능하다고 밝힘. — 링크
    • 관련 주제: AI Agents
  • Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents — SemiAnalysis AgentX 벤치마크 기준 Vera Rubin NVL72가 GB300 NVL72 대비 메가와트당 처리량 최대 30배, 토큰당 비용 최대 35배 개선을 보고. 분산 서빙·전문가 병렬화·분산 KV 캐싱·융합 CUDA 커널이 개선 요인으로 제시됨. — 링크
    • 관련 주제: AI Agents

Apple ML Research

  • Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning — 비디오 추론에서 Visual Chain-of-Thought의 계산 비효율을 지적하며, 학습 시에는 시각적으로 사고하되 추론 시에는 직접 답을 내는 Internalized Visual Thinking(IVT)을 제안. 중간 추론 이미지 생성 없이 학습 중 미래 프레임의 잠재 표현을 예측하도록 해, Visual CoT와 동등한 성능을 유지하면서 종단간 지연을 5배 이상 줄였다고 보고. — 링크
    • 관련 주제: Reasoning
  • STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation — 기존 통합 멀티모달 모델이 이산화로 화질을 희생하거나 텍스트·디퓨전 결합으로 구조적 비대칭을 만드는 문제에, 언어모델과 동일한 인과적 메커니즘을 공유하는 자기회귀 정규화 흐름으로 연속적·단일 패스 멀티모달 생성을 구현하는 STARFlow2를 제안. — 링크
    • 관련 주제: none

arXiv 신규

색인 상태: 넓은 조회(600건, covered: true)의 최신 게재(newest_fetched)가 2026-08-24T17:59:39Z로, 실행 시각(2026-08-25T22:38Z) 대비 약 1.2일 지연. 직전 커서(2026-08-21T17:59:37Z) 대비로는 사흘치 창이 새로 열려 595건의 신규 후보가 나왔다. 지연폭(3.2일→1.2일)이 뚜렷이 좁혀지고 있으나 아직 "오늘/어제 수준"에 완전히 도달했다고 보기는 이르므로, 6절 커서 규칙에 따라 이번 창에서 실제로 관측된 최신 게재 시각으로 커서를 전진시킨다(자세한 사유는 레이더 로그 참고).

AI Agents

  • The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams (2608.23541) — 멀티에이전트 상호작용이 성능을 높인다는 보고와 비용만 늘린다는 보고가 공존하는 모순을, "모든 통신이 동등하지 않다"는 구분으로 설명. 에이전트가 서로의 전체 출력을 읽으면 제안이 빠르게 수렴해 모델 계열 간 서로 다른 해법 다양성이 사라진다는 것을 보임.
  • The Compaction Cliff in Long-Running AI Agent Memory (2608.22752) — 컨텍스트가 넘치면 안전 규칙과 에피소드 로그가 같은 속도로 요약되는데, 규칙만은 문구 그대로 보존돼야 한다는 문제를 지적. 20개 프로덕션 에이전트 설정에서 Claude Code의 /compact가 한 번 압축 후 안전 규칙의 53%, 다섯 번 후 10%만 보존함을 실측하고, 지식 종류별로 다른 보존 정책을 적용하는 Knowledge Triage로 대응.
  • Noise Floor Audit for Agent Benchmarks (2608.22331) — 2개 제공사의 3개 네이티브 tool-calling 엔드포인트에서 BFCL 벤치마크 측정 변동성을 감사. temperature 0 재실행은 거의 결정적이지만, 의미를 보존하는 프롬프트 변형이 재실행보다 11~58배 큰 변동을 만들어 "한계 정확도"가 안정성뿐 아니라 실패 양상(정형식 오류 비율 등)까지 가린다는 것을 보임.

AI Scientist / Automated Research

  • Closed-loop AI achieves certifiable engineering design (2608.21976) — 자연어 요구사항을 설계 도메인 기하로 변환하고 위상 최적화(BESO+CalculiX)와 부재 치수 최적화(PSO+Zwind)를 폐루프로 결합한 "The AI Engineer"를 제시. 5개 항목 자동 심사로 후보를 걸러 최고 점수 설계를 중국선급(CCS)에 실제 제출해 원칙승인(AIP)을 통과시켰고, 인간 최적화 베이스라인 대비 강재 중량·단위 자본비용을 각 8.1% 절감.
  • GRAFT: Graph-Distilled Generative Retrieval for Facet-Aware Scientific Literature Exploration (2608.22381) — 문헌 검색이 문제·방법·결과·기여로 다르게 연결되는 관계를 단일 유사도 점수로 뭉갠다는 문제에, 4개 관계로 유형화된 논문 그래프를 생성적 검색기로 증류. 11,359편 코퍼스(LitWeave)에서 인덱스·인코더 없이 그래프 교사 Recall@20의 91%를 재현하고, 반환된 논문마다 어떤 관계로 검색됐는지 라벨(정밀도 0.922)을 함께 제공.

Hypothesis Generation

  • What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation (Lit2Test) (2608.22948) — 연구 아이디어 채점의 기존 두 방식(자유형 심사·미래 논문 정답) 모두 결정 규칙이 없다는 문제에, 문헌 갭·가설·최소 실험·결정적 지표·지지/반증 결과 6필드 계약을 채점 단위로 삼는 벤치마크를 제안. 200개 정답 없는 문헌 이웃에서 4개 프런티어 모델을 order-audited pairwise 판정으로 비교해 10,000회 부트스트랩 전부에서 재현되는 강건한 순위를 도출.

Long-context

  • RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored (2608.22118) — 모델이 재귀적으로 자기 출력을 학습하면 붕괴(model collapse)한다는 기존 결과를, 검색 도구로 "자신이 작성한" 문서를 다시 인용하는 RAG 상황으로 확장. AI 생성 콘텐츠가 인터넷을 채워가는 자기강화 피드백 루프에서 유사한 붕괴가 일어남을 실험으로 보임.
  • MegaMem: A Retrieval Solution for Ultra-Large Context Windows (2608.22137) — 전체 코드베이스·장기 상호작용 이력·이질적 기업 레코드에 걸친 영속 메모리를 다루기 위해, 의미 접근과 생성 근거를 분리하는 이중 뷰 검색 시스템을 제안. 증류된 레코드와 상세 근거를 각각 원본·변환 질의로 검색하고 불변 소스 ID로 재결합해 수억 토큰 규모에서도 근거를 추적 가능하게 유지.

Reasoning

  • The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning (2608.21871) — 검증 가능 보상 기반 RL이 대규모 사람 큐레이션 과제 모음을 전제한다는 한계에, zero-data self-play를 추격-도피 게임으로 재구성한 LURE를 제안. 평가자(evader) 역할의 LLM이 난이도 축을 따라 과제를 배치해 플래너-실행자 추격자보다 한 발 앞서 있도록 함으로써, 기존 방법처럼 후보를 사후 검증·기각하는 대신 학습 가능성이 있는 위치를 스스로 학습.
  • Cognitive Profiling of LRMs' Reasoning Traces Using Bloom's Taxonomy (2608.23205) — 추론 모델(LRM)이 생성하는 추론 트레이스에서 실제로 어떤 유형의 사고가 쓰이는지가 잘 규명되지 않았다는 문제에, Bloom의 인지 분류(기억·적용·평가 등 6단계)로 추론 단계를 자동 주석하는 프레임워크를 제안. 표면적 정답 여부를 넘어 추론 과정 자체의 인지적 구성을 정량화하는 것을 목표로 함.

Paper Radar 채택1보류0탈락1

조회 600건 · 신규 595건 · 채택 1 · 보류 0 · 탈락 1

색인 상태: 넓은 조회(600건, covered: true)의 최신 게재가 2026-08-24T17:59:39Z(2608.23045)로, 실행 시각(2026-08-25T22:38Z) 대비 약 1.2일 지연되어 있습니다. 직전 커서(2026-08-21T17:59:37+00:00)에서 사흘치 창이 새로 열려 595건의 신규 후보가 나왔고, 그중 topics.toml 키워드에 걸리는 좁은 관문(radar_match) 후보는 2건이었습니다. 지연폭이 지난 사흘(3.2일 → 1.2일)에 걸쳐 뚜렷이 좁혀지고 있지만, 실행 시각 기준 KST로도 최신 게재가 "어제"에 걸쳐 있어 완전히 정상 수위로 보기는 이릅니다. 6절 커서 규칙에 따라 last_run을 실행 시각이 아니라 이번에 실제로 관측된 최신 게재 시각(2026-08-24T17:59:39+00:00)으로 전진시킵니다.

채택

  • Lit2Test — What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation
    • arXiv: 2608.22948
    • 통과 근거: Gate B-1 — 기존 두 채점 방식(자유형 심사·미래 논문 정답)이 결정 규칙을 결여한다는, 우리 코퍼스(TasteGap·ImplementationLottery)가 이미 지적해온 "LLM 심사 점수가 실행을 예측 못한다"는 문제를 정면으로 겨냥한 새 프레이밍. 이전에 유사 사례(Tree-of-Ideas, 2026-08-13)가 LLM-judge 점수 차이만으로 held 처리됐던 것과 달리, 이번 논문은 order-audited pairwise 판정(950 order-stable/250 order-sensitive 분리 보고) + 독립 2차 심사자 재현(86.1% 일치) + 명백/미묘 단일 필드 조작 실험(모든 신뢰구간이 0 배제) + 3인 인간 보정(87.2% 일치)까지 갖춰, "명확히 충족" 기준을 만족하는 드문 수준의 증거를 제시함.
    • 파일: 2026/2026_Lit2Test_Falsifiable-Research-Ideation-Benchmark_arXiv2608.22948.pdf · 리뷰: 2026/2026_Lit2Test_Falsifiable-Research-Ideation-Benchmark_리뷰.md

보류

없음

탈락

  • From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation — 2608.23045 — Gate A 탈락: "deep research agent"라는 표현 때문에 좁은 관문에 걸렸으나, 핵심 기여는 웹 검색 QA 에이전트(GAIA·WebWalkerQA·BrowseComp)가 자기 이전 행동을 평가할 때 객관성을 잃는 "inertia bias"를 진단하고 컨텍스트 격리로 완화하는 것. 자율 연구 파이프라인·가설 생성·아이디어 평가 어느 것도 아니고, LLM/에이전트를 정보 검색 도구로 쓰는 일반 응용 논문.

번역본: 2026-08-26.en.md, 2026-08-26.es.md

지난 호 다시 보기

2026-09-14 기관 11 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-05 기관 1 · arXiv 10 · 채택 0 · 보류 0 · 탈락 0 2026-09-04 기관 6 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-03 기관 3 · arXiv 15 · 채택 2 · 보류 1 · 탈락 4 2026-09-02 기관 3 · arXiv 15 · 채택 2 · 보류 3 · 탈락 4 2026-09-01 기관 2 · arXiv 13 · 채택 0 · 보류 1 · 탈락 1 2026-08-31 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-30 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-29 기관 2 · arXiv 14 · 채택 2 · 보류 0 · 탈락 2 2026-08-28 기관 9 · arXiv 14 · 채택 0 · 보류 0 · 탈락 2 2026-08-27 기관 8 · arXiv 11 · 채택 0 · 보류 0 · 탈락 2 2026-08-25 기관 1 · arXiv 12 · 채택 0 · 보류 0 · 탈락 1 2026-08-24 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-23 기관 2 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-22 기관 4 · arXiv 15 · 채택 0 · 보류 0 · 탈락 2 2026-08-21 기관 5 · arXiv 3 · 채택 0 · 보류 0 · 탈락 4 2026-08-20 기관 2 · arXiv 9 · 채택 2 · 보류 1 · 탈락 0 2026-08-19 기관 2 · arXiv 14 · 채택 1 · 보류 0 · 탈락 3 2026-08-18 기관 1 · arXiv 15 · 채택 2 · 보류 1 · 탈락 0 2026-08-17 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-16 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-15 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-14 기관 4 · arXiv 14 · 채택 2 · 보류 1 · 탈락 3 2026-08-13 기관 3 · arXiv 15 · 채택 1 · 보류 1 · 탈락 0 2026-08-12 기관 2 · arXiv 11 · 채택 0 · 보류 0 · 탈락 1 2026-08-11 기관 1 · arXiv 13 · 채택 0 · 보류 0 · 탈락 6 2026-08-10 기관 0 · arXiv 0 · 채택 10 · 보류 0 · 탈락 0 2026-08-09 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-08 기관 8 · arXiv 14 · 채택 2 · 보류 1 · 탈락 4 2026-08-07 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-06 채택 0 · 보류 0 · 탈락 0 2026-08-04 채택 2 · 보류 3 · 탈락 9