Daily Update

바쁜 아침에 대신 읽어드리는 자율 연구 소식

리서치 레이더

2026년 8월 28일 (금) 기관 9 · arXiv 14 · 채택 0 · 보류 0 · 탈락 2

기관 리서치

Google DeepMind

  • Piloting the world's first double-blind AI evaluations — Google Cloud Confidential Computing으로 평가 데이터와 모델 가중치를 암호학적으로 격리해, 평가자는 모델을 못 보고 회사는 테스트 프롬프트를 못 보는 "이중맹검" 평가 체계를 파일럿. 벤치마크 오염(모델이 테스트 문항에 사전 노출됐을 가능성) 문제를 겨냥한 시도로, Gemini Flash Lite 모델을 싱가포르 AI Safety Institute·MLCommons 등 외부 기관과의 파트너십으로 기밀 벤치마크에 시험함. — 링크
    • 관련 주제: Reasoning (평가 방법론)
  • Gemini Omni 1.1 Flash lets you build with more control — ⚠ 본문 확인 실패: 원문이 blog.google로 리다이렉트되는데 해당 도메인이 egress 정책에 막혀 있어 제목·게시일만 확인함. — 링크
  • Intelligent transcription with Gemini 3.5 Transcribe — ⚠ 본문 확인 실패: 위와 동일한 사유(blog.google 리다이렉트 차단)로 제목·게시일만 확인함. — 링크

Google Research

  • Planetary prediction engine: Automating global models via Earth AI — Google Earth Engine 등 저장소에서의 지능형 데이터 선정→파운데이션 모델 임베딩 기반 멀티모달 데이터셋 큐레이션→과적합 방지 안전장치를 갖춘 자동 모델 빌드까지, 지구과학 모델링 전체 워크플로우를 사람 개입 없이 수행하는 자율 시스템(PPE)을 공개. CDC 건강지표 예측 R² 76.8%(베이스라인 60.0%), 나이지리아 식량안보 다운스케일링 정확도 66.1%(베이스라인 31.5%, 약 2배), 2026 DRC 에볼라 발병 핫스팟 탐지 recall 83.3%을 보였고 모델 개발 시간을 수 주에서 수 분으로 단축했다고 주장. — 링크
    • 관련 주제: AI Agents (엔드투엔드 자동화 워크플로우이나 지구과학 도메인 응용이라 레이더 Gate A와는 무관)
  • GlucoFM: Foundation model for continuous glucose monitoring — 연속혈당측정(CGM) 전용 경량 자기지도 파운데이션 모델. Wear-CGM 연구 등 5개 데이터셋·참가자 477명의 비표기 CGM 109,066시간으로 사전학습했고, 느린 혈당 추세와 짧은 변동을 분리 모델링하는 이중 스트림 구조로 대사질환 예측 과제에서 경쟁 기법 대비 평균 PR-AUC +5.8%p, 특히 당뇨 위험·베타세포 기능장애 평가에서 강세를 보이며 소수샷 전이 능력도 보고. — 링크

OpenAI

  • 신규 없음 (RSS 최신 항목이 각각 8/1, 7/28로 커버 범위 이전)

Anthropic

  • Enabling independent research on how people use Claude — 외부 연구자에게 실제 Claude 대화 데이터를 프라이버시 보존 분석 도구 "Anthropic Insights"로 접근시켜 독립 연구를 지원하는 프로그램을 발표. 3개 연구기관이 약 25만 건의 대화를 분석해 인간-AI 협업 효과, 사용자 정서적 몰입, 코딩 에이전트의 생산성 향상 등을 연구했으며, 기업이 자체 발표한 분석이나 공개 데이터셋에만 의존하지 않고 외부 연구자가 직접 질문을 던질 수 있게 한다는 데 의의가 있다고 설명. — 링크

Meta FAIR / Meta AI

  • 신규 없음 (최신 게시물이 7/27로 커버 범위 이전)

Microsoft Research

  • 신규 없음 (RSS 최신 게시물이 8/20, lastBuildDate도 8/25로 커버 범위 이전)

NVIDIA Research

  • 신규 없음 — research.nvidia.com/publications의 게시물은 월 단위 날짜만 표기돼 커버 범위 내 신규 여부를 특정할 수 없었고, 확인 가능한 blogs.nvidia.com/feed/(폴백) 최신 글들은 Vera CPU 출하·NVLink Fusion 등 하드웨어/인프라 제품 발표로 연구 게시물이 아니라 제외.

Apple ML Research

  • Rubric-Based Alignment for Grounded Knowledge Answers — 개방형 QA용 보상모델 학습에서 단일 스칼라 보상 대신, 검색된 근거에 기반한 질의별 루브릭을 여러 품질 차원으로 분해해 사용하는 프레임워크를 제안. 구성·근거성·지시 순응 등 평가 지표에서 instruction-tuned 베이스라인 대비 +6.5%, 평평한(flat) 루브릭 변형 대비 +4% 개선을 보고. — 링크
    • 관련 주제: Reasoning (보상/평가 설계)
  • PROOF-Gen: From Optimized Data to Better Distillation — 교사 모델의 실패한 생성 궤적을 버리지 않고, 리플렉터가 실행 트레이스와 평가 피드백을 분석해 교정 지침을 써준 뒤 교사가 그 지침으로 성공 궤적을 다시 생성하게 하는(학생 학습 시엔 지침 제거) distillation 데이터 파이프라인. τ2-bench에서 실패 시나리오의 93%를 복구했고, Qwen3-4B의 pass rate가 0.132→0.529로 상승, 배포 모델 목표달성률 +6.3%p(비영어권 평균 +1.48%p) 개선. — 링크
    • 관련 주제: Reasoning (학습 데이터 파이프라인)
  • IDEA Prune: Integrated Enlarge-and-Prune Pipeline — 확대 사전학습(enlarge)과 구조적 프루닝을 하나의 코사인 어닐링 학습률 스케줄 아래 통합한 모델 압축 파이프라인. 28억→13억 파라미터 압축, 최대 2조 토큰 사전학습 실험에서 기존 단순 enlarge-and-prune이 겪는 "학습률 재상승에 따른 지식 손실"을 완화해 더 나은 파라미터 재배치와 성능을 달성했다고 보고. — 링크

arXiv 신규

AI Agents

  • SwarmWorld: Stigmergic technological evolution in societies of language-model agents (2608.26081) — 사전 정의된 역할·직접 대화·중앙집중 워크플로우 없이, 동질적인 LLM 에이전트들이 공유 환경에서 자원을 채취·조합·검증하며 스스로 조직화하는지 시험. 결정론적 시뮬레이터가 에이전트 제거 후에도 살아남는 "기능"만을 평가하는 방식으로 인지(제안)와 결과(작동 여부)를 분리했으며, 공유 사회는 최강 best-of-N 독립 탐색 베이스라인보다 더 넓고 회복력 있는 기술 포트폴리오를 만들었으나 단일 최고 성능 발명에서는 독립 탐색도 경쟁력 있었음.
  • Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems (2608.25920) — 멀티에이전트 시스템(MAS) 디버깅 도구들이 실제로 실패를 "인과적으로" 고치는지, 아니면 LLM 샘플링의 무작위성에 기대 "우연히" 고치는지를 검증하기 위해, 개입 지점 이전을 로그로 재구성하고 그 이후만 재생성하는 통제된 재현 프레임워크 SymTrace와 536건의 사람이 주석 단 실패 데이터셋 SymFail을 제안. 기존 무유도 재실행은 실패 재현율 67.97%에 비해 수리율은 6.90%에 그쳤고, 증상 기반 개입 방법은 수리율을 20.15%(기존 SOTA 대비 +191.89%)까지 끌어올림.
  • Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems (2608.26036) — 정답 정확도만으로는 LLM 데이터 에이전트의 신뢰성을 판단할 수 없다고 주장하며, 계산 과정이 명시적·실행 가능·스키마 유효·연산자 충실·재생 가능·정답 일치·감사 가능한지를 따지는 "Trace Integrity" 기준과 CAIT(정답이지만 트레이스는 무효인) 비율 지표를 제안. BIRD Mini-Dev에서 세 SQL 에이전트 변형이 정답 정확도 20~24%를 냈지만 Trace Integrity 통과율은 39~43%에 불과했고 CAIT 비율은 45.8~59.1%에 달해, 많은 "정답"이 사실 무효한 계산에 기반함을 보임.
  • Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World (2608.25091) — 에이전트 "Skill"(행동 서술)과 "Policy"(어떤 행동이 실행 가능한지 결정)를 구분하고, 자가진화형 스킬 하니스가 안전성 확보 없이 오케스트레이션만 자동으로 늘려 이 간극을 키운다고 지적. Skill 아티팩트 내부에 세계 상태·센서 증거 기반 가드를 심는 타입드 권한 계층 Edge Skillguard를 제안했으며, 실제 엣지 제어 테스트베드에서 5가지 공격 변형에 걸친 "권한 대여" 요청 60/60건을 정상 요청을 막지 않으면서 차단.

AI Scientist / Automated Research

  • Federation Is Nearly Free, Reasoning Is Not: Tradeoffs for AI Co-Scientists in Protein Characterization Workflows (2608.25215) — 단백질 서열이 주어졌을 때 기능을 특정하는 검증 가능한 과제로 AI 공동연구자(co-scientist) 워크플로우의 연합 토폴로지·RL 대 LLM 하니스·모델 선택·프롬프트 전문성 간 트레이드오프를 통제된 절제 실험으로 평가. LLM 선택이 토폴로지·프롬프팅보다 압도적으로 예측 품질을 좌우했고(Opus ~92~94% vs o4-mini ~40~50%), 제로 토큰 비용의 PPO 정책이 최고 LLM(88%)에 근접하면서 지연시간 최소·재현성 완벽이었지만 추론 흔적은 남기지 못했으며, 연합 자체의 성능 손실은 미미했음.
  • BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks (2608.25286) — 원시 생물학 데이터를 받아 완결된 연구 스터디 수준의 분석을 수행하는 AI 에이전트 능력을 20개 과제·138개 산출물로 측정하는 벤치마크. 13개 프론티어 모델 중 최고점(GPT 5.6 Sol)도 0.48에 그쳤고, 데이터셋이 클수록(100GB 이상: 0.10) 분석 단계가 많을수록(3단계 이상: 0.24) 성능이 급락했으며, 과제당 평균 6.8시간·1.02억 토큰·43달러가 들었고 최장 시도는 24시간·10.7억 토큰·525달러를 소모.

Hypothesis Generation

  • Think-Probe-Respond: Improving Large Language Models as Judges of Research Idea Novelty (2608.25660) — LLM이 연구 아이디어의 참신성을 판정할 때 전문가와 유사한 추론 근거를 생성하면서도 최종 판정은 "중간 정도로 참신함"으로 쏠리는 체계적 편향을 발견. 추론 단계의 은닉 상태에서 잠재적 참신성 판단을 프로빙해 최종 응답을 그 값에 조건화하는 경량 기법 Think-Probe-Respond(TPR)로 참신성 판정 성능을 22.30% 개선하고 편향을 완화.

Long-context

  • Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context (2608.25655) — 세션·주제 경계가 명시된 기존 장기 대화 메모리 벤치마크와 달리, 여러 주제가 뒤섞인 단일한 긴 스레드에서 이후 과제 판단에 어떤 이전 에피소드가 인과적으로 관련 있는지 추론해야 하는 더 어려운 상황을 겨냥한 벤치마크 SCALE-QA(10개 도메인, 3,000문항, 128k~1M 토큰)를 제안. 에피소드를 분할해 계층적 다중 뷰 메모리 스택으로 색인하는 TSIM 기법이 3개 백엔드 전반에서 최강 베이스라인 대비 5.6~17.6점 높은 정확도를 기록.
  • A Storage-Retrieval Gap in Parametric Knowledge Graph Memory (2608.25489) — 매 호출마다 컨텍스트에 서브그래프를 넣는 그래프 RAG 대신, 지식 그래프를 엔티티별 LoRA 어댑터 뱅크로 오프라인 컴파일해 쿼리 시점엔 텍스트가 아닌 가중치 주입으로 지식을 불러오는 방식을 연구. MetaQA에서 올바른 어댑터는 거의 눈먼 폐쇄형 베이스 대비 +0.243 EM을 회복하지만, 유사도 기반 어댑터 검색은 우연 수준 성능에 그쳐 지식이 어댑터에 국소적으로 저장될 뿐 임베딩 근접성으로는 전이되지 않는다는 점을 핵심 미해결 문제로 지목.
  • Trust the Mass: Forced Weights in KV-Cache Eviction (2608.25230) — 5개 모델의 168,192개 어텐션 행에서 최적 부분집합을 전수 탐색한 결과, 단순히 "가중치가 큰 키를 남긴다"는 규칙이 이미 전체 어텐션과의 격차 중 중앙값 2~5%만 남기는 near-optimal 수준임을 확인. 즉 발표된 KV-cache eviction 기법들 간 성능차는 대부분 선택 알고리즘이 아니라 저장 방식(래그드 per-head 마스크 등)에서 온다는 것으로, 실제 고정 바이트 예산을 강제하면 14~62점의 벤치마크 손실이 발생함을 보임.

Reasoning

  • PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems? (2608.25097) — 그림·단계별 중/영 이중언어 풀이가 포함된 11,586개 올림피아드급 물리 문제로 구성된 대규모 벤치마크. 18개 오픈/폐쇄형 MLLM을 평가한 결과 최강 모델도 정답률 33.7%에 그쳤고, 단계별 과정 평가로 추론 사슬이 어디서 무너지는지 진단.
  • One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation (2608.25936) — 새 실험 없이 기존 문헌을 정리한 리뷰로, 더 큰 교사 모델 없이 자기 자신을 특권 정보(정답·계획·환경 피드백)로 조건화해 스스로를 채점하는 On-Policy Self-Distillation(OPSD)의 지배적 실패 모드인 "붕괴"(도달 가능한 추론 경로의 점진적 축소)를 신호 적용 위치·특권 정보의 종류·교사 가이드 감쇠 시점이라는 세 지렛대로 구조화해 설명.
  • Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence (2608.25869) — 이전 점수를 단순 맥락 메타데이터로만 포함해도 LLM 심사자의 새 채점이 그 값 쪽으로 유의하게 앵커링됨을 19만 2천 건 평가에서 확인(8개 모델 중 7개가 유의한 효과, Cohen's d 최대 0.71). 사람이 라벨링한 산업 데이터에서는 앵커링된 메타데이터가 정당한 오류 수정의 48%를 막고 올바른 판정의 10.18%를 오답으로 뒤집었으며, Chain-of-Thought도 "메타데이터 무시" 경고도 이 효과를 없애지 못함.
  • GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning (2608.25583) — 동일 구조의 추론 특화 모델과 지시 특화 모델 사이를 모듈별로 보간하는 비율을 학습하는 기법(두 원본 모델은 고정). 정답이면서 간결한 응답을 선호하는 보상 신호로 보간 비율만 최적화해, 고정 비율·탐색 기반 모델 병합 베이스라인보다 나은 정확도-효율 트레이드오프를 달성하고 모듈별 융합 패턴을 분석.

Paper Radar 채택0보류0탈락2

조회 313건 · 신규 313건 · 채택 0 · 보류 0 · 탈락 2

색인 상태: 넓은 조회(313건, covered: true)의 최신 게재가 2026-08-26T17:59:51Z로, 실행 시각(2026-08-27T22:38:02Z) 대비 약 1.2일 지연되어 있습니다. 직전 커서(2026-08-25T17:58:46+00:00, 지난 이틀 로그에서 같은 사유로 실행 시각 대신 관측 최신값으로 전진시켰던 값)에서 하루치 창이 새로 열려 313건의 신규 후보가 나왔고, 그중 topics.toml 좁은 관문(radar_match)에 걸린 후보는 2건이었습니다. 지연폭이 최근 며칠과 거의 동일하게 유지되고 있어, 6절 커서 규칙에 따라 이번에도 last_run을 실행 시각이 아니라 이번 조회에서 실제로 관측된 최신 게재 시각(2026-08-26T17:59:51+00:00)으로 전진시킵니다.

채택

없음

보류

없음

탈락

  • Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role — 2608.26093 — Gate A 탈락: "autoresearch protocol"이라는 표현으로 좁은 관문에 걸렸으나, 핵심 기여는 기존 자율연구 프로토콜(AI 코딩 에이전트가 학습 스크립트를 수정·실행·채택/기각)을 셀-에지 전력 제어라는 특정 무선통신 공학 문제에 적용한 결과. 자율 연구 파이프라인 자체의 새 방법론이 아니라 도구로서의 에이전트를 응용 도메인에 쓴 논문.
  • AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research — 2608.25559 — Gate A 탈락: "deep research"라는 표현으로 좁은 관문에 걸렸으나, 핵심 기여는 비디오 이해+웹 검색 질의응답을 위한 적응적 툴 호출·리플렉션 에이전트. 자율 연구 에이전트도, 가설 생성·탐색·실험 설계도, 연구 아이디어 평가도 아닌 비디오 QA 응용 논문.

번역본: 2026-08-28.en.md, 2026-08-28.es.md

지난 호 다시 보기

2026-09-14 기관 11 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-05 기관 1 · arXiv 10 · 채택 0 · 보류 0 · 탈락 0 2026-09-04 기관 6 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-03 기관 3 · arXiv 15 · 채택 2 · 보류 1 · 탈락 4 2026-09-02 기관 3 · arXiv 15 · 채택 2 · 보류 3 · 탈락 4 2026-09-01 기관 2 · arXiv 13 · 채택 0 · 보류 1 · 탈락 1 2026-08-31 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-30 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-29 기관 2 · arXiv 14 · 채택 2 · 보류 0 · 탈락 2 2026-08-27 기관 8 · arXiv 11 · 채택 0 · 보류 0 · 탈락 2 2026-08-26 기관 5 · arXiv 10 · 채택 1 · 보류 0 · 탈락 1 2026-08-25 기관 1 · arXiv 12 · 채택 0 · 보류 0 · 탈락 1 2026-08-24 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-23 기관 2 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-22 기관 4 · arXiv 15 · 채택 0 · 보류 0 · 탈락 2 2026-08-21 기관 5 · arXiv 3 · 채택 0 · 보류 0 · 탈락 4 2026-08-20 기관 2 · arXiv 9 · 채택 2 · 보류 1 · 탈락 0 2026-08-19 기관 2 · arXiv 14 · 채택 1 · 보류 0 · 탈락 3 2026-08-18 기관 1 · arXiv 15 · 채택 2 · 보류 1 · 탈락 0 2026-08-17 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-16 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-15 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-14 기관 4 · arXiv 14 · 채택 2 · 보류 1 · 탈락 3 2026-08-13 기관 3 · arXiv 15 · 채택 1 · 보류 1 · 탈락 0 2026-08-12 기관 2 · arXiv 11 · 채택 0 · 보류 0 · 탈락 1 2026-08-11 기관 1 · arXiv 13 · 채택 0 · 보류 0 · 탈락 6 2026-08-10 기관 0 · arXiv 0 · 채택 10 · 보류 0 · 탈락 0 2026-08-09 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-08 기관 8 · arXiv 14 · 채택 2 · 보류 1 · 탈락 4 2026-08-07 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-06 채택 0 · 보류 0 · 탈락 0 2026-08-04 채택 2 · 보류 3 · 탈락 9