Daily Update

바쁜 아침에 대신 읽어드리는 자율 연구 소식

리서치 레이더

2026년 9월 2일 (수) 기관 3 · arXiv 15 · 채택 2 · 보류 3 · 탈락 4

기관 리서치

Google DeepMind

  • Introducing agentic video understanding with Gemini — Gemini에 영상을 이해하고 그 내용에 따라 후속 행동을 계획·실행하는 "에이전틱 비디오 이해" 기능을 도입했다는 발표. 영상 콘텐츠를 단순 인식하는 것을 넘어 영상에서 추출한 맥락을 바탕으로 도구 호출·후속 작업을 잇는 에이전트 파이프라인 확장이다. — 링크
    • 관련 주제: AI Agents

Google Research

  • Mapping global methane emissions from space with deep learning — 위성 관측 데이터에서 딥러닝으로 전 지구 메탄 배출원을 지도화하는 연구. 기후·지속가능성 도메인에 대한 응용이며 핵심 3토픽과는 직접 관련이 없다. — 링크

OpenAI

  • 신규 없음 (RSS 최신 항목들이 AI Adoption/Safety/Product/Company 카테고리이며 Research/Publication 카테고리 신규 항목 없음 — "Path to Astra" 게시물도 Safety 카테고리로 분류되어 필터 대상 아님)

Anthropic

  • 신규 없음 (연구 페이지 최신 항목은 여전히 "Automated researchers can reliably mitigate alignment failures", 2026-08-28로 이번에도 커버 범위 이전. 다만 이 연구의 arXiv 논문(2608.28945)이 오늘 색인되어 Paper Radar에서 별도로 채택됨 — 3절 참고)

Meta FAIR / Meta AI

  • 신규 없음 (블로그 최신 항목이 2026-07 하순 이후 갱신 없음)

Microsoft Research

  • 신규 없음 (RSS 최신 항목 GigaPath-Flash/GigaTIME-Flash는 2026-08-31로 어제 브리핑에서 이미 다룸; 그다음 항목은 2026-08-20으로 더 오래됨)

NVIDIA Research

  • NVIDIA and CrowdStrike Strengthen Agentic Cybersecurity Frontier — publications 페이지는 여전히 컨퍼런스 발표일 기준 정렬이라 부적합했고, 보조 확인한 blogs.nvidia.com/feed/에서 확인. CrowdStrike SafeMind라는 에이전틱 사이버보안 시스템을 NVIDIA Nemotron 기반으로 발표했으며, 공격측·방어측 AI가 서로를 상대로 지속 개선하는 "continuous coevolution" 구조를 특징으로 내세운다. 연구 성과라기보다 제품·파트너십 발표에 가깝다. — 링크
    • 관련 주제: AI Agents

Apple ML Research

  • 신규 없음 (RSS 최신 항목이 2026-08-28로 커버 범위 이전, 이후 갱신 없음)

arXiv 신규

AI Agents

  • Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization (TASPO) (2608.31077) — outcome 기반 RL이 궤적 전체에 균일하게 advantage를 주는 문제와, on-policy self-distillation의 privileged-information 신호가 실행 가능한 행동 단위와 맞지 않는 "supervision-credit gap" 문제를 지적한다. 검증된 성공 경험에서 뽑은 privileged information을 행동 단위로 집계해 원래 궤적 advantage에 대한 양의·유계·평균보존 가중치로 변환하는 TASPO를 제안, 3개 에이전트 벤치마크에서 GRPO 대비 10.6% 개선.
    • 관련 주제: AI Agents, Reasoning
  • Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents (2608.31057) — 코딩 에이전트의 작업 메모리(지시문·산출물·툴 출력·에이전트 생성 상태)가 의미론적으로 이질적이라는 점에 착안해, 55개 실제 코딩 에이전트 궤적을 분석한다. 의미 인지형 압축·검색 기반 정책을 평가한 결과 캘리브레이션 이득이 held-out 태스크로 전이되지 않고, 동일한 토큰 예산이 동일한 전달 맥락·관리 비용을 의미하지 않음을 보인다.
    • 관련 주제: AI Agents, Long-context
  • Selection-Aware Stress Testing for Interactive Agents (SASST) (2608.30916) — 에이전트 평가가 한 벤치마크로 워크플로우를 고른 뒤 그 우위가 약해지는 태스크 유형을 같은 데이터에서 찾는 "이중 사용" 문제를 지적하고, discovery/confirmation 분할과 조건부 점근 타당성 증명을 갖춘 평가 프로토콜을 제안한다. τ-bench 480 에피소드 사례에서 discovery 단계의 3.75점 우위가 confirmation 단계에서 사라지는 것을 실증한다.
    • 관련 주제: AI Agents, Reasoning

AI Scientist / Automated Research

  • PaperGym: Rubric-Centered Evolution for Research-Plan Generation (2608.31119) — 연구 논문을 질문(Goal+Background)과 정답·rubric(Method+Experimental Design)이 서로 다른 섹션에서 나오도록 분해해 criterion leakage를 3.7%로 낮춘 훈련 환경 PaperGym-20k를 구축하고, 같은 rubric을 self-distillation teacher context와 GRPO reward로 이중 재사용하는 2단계 스케줄로 Qwen3-8B가 ResearchQA에서 더 큰 Kimi K2.6을 상회하는 결과를 낸다. (Paper Radar 채택, 3절 참고)
    • 관련 주제: AI Scientist / Automated Research, Hypothesis Generation
  • Automated Researchers Can Reliably Mitigate Alignment Failures (AAR) (2608.28945) — Anthropic의 자율 정렬 연구자(AAR) 하네스가 10개 정렬 실패(기만·아첨·탈옥 등)를 hill-climb해 역량을 보존하며 벤치마크 밖으로도 일반화되는 완화 방법을 찾고, 평균 2.5년 경력 인간 연구자 28명의 1회성 제안을 평균 6.4시간 내에 능가한다. 숨겨진 held-out·기하평균·코드검토 모니터 등 게임 방지 설계가 특징. (Paper Radar 채택, 3절 참고)
    • 관련 주제: AI Scientist / Automated Research
  • Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents (AutoSciRub) (2608.31076) — 개방형 연구 태스크의 암묵적 성공 기준을 실행 전에 명시적 rubric으로 유도해 자율 연구 에이전트의 실행·검증·수정을 가이드하는 평가-우선 프레임워크. ResearchClawBench에서 평균 2.08~2.95점, AstaBench E2E Discovery 서브셋에서 평균 16.8점 개선.
    • 관련 주제: AI Scientist / Automated Research, Hypothesis Generation
  • Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks (2608.30047) — MLE-Bench의 10개 Kaggle형 과제에서 AIDE·AIRA-Dojo 두 연구 에이전트의 창의성을 심리적 신규성(자기 이전 해와 비교)·역사적 신규성(인간 해와 비교)·유용성 세 축으로 평가한다. 모든 에이전트가 탐색→활용 국면 전환에서 창의성이 감소하고, LLM이 메달권 인간보다 역사적 신규성은 높지만 성능은 낮다는 발견.
    • 관련 주제: AI Scientist / Automated Research, Hypothesis Generation

Hypothesis Generation

  • Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment (2608.29696) — 14개 프론티어 LLM과 2개 베이스모델 위의 5개 연구 에이전트 아키텍처가 낸 아이디어를 105명의 활동 중인 컴퓨터과학 연구자가 6,000건 이상 이중맹검 페어 비교로 평가해 Elo 리더보드를 구축한다. 최고 LLM judge도 인간 선호 재현에서 72.56% Soft Accuracy에 그쳐 자동 평가자가 아직 전문가 선호를 신뢰성 있게 대체하지 못함을 보인다.
    • 관련 주제: Hypothesis Generation
  • EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning (2608.29835) — 장문 서사 추론에서 근거 없는 중간 가설이 이후 추론을 오염시키는 문제를 다룬다. 서사를 근거 원자 단위로 고정한 뒤 각 후보 가설을 이 저장소에 대조해 지지/보류/기각으로 분류하고 충분성 기반 정지 규칙으로 불필요한 정제를 막는다.
    • 관련 주제: Hypothesis Generation, Reasoning

Long-context

  • TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories (2608.30811) — 훈련 없이 모델에 구애받지 않는 장문맥 압축 프레임워크로, 스팬을 밀집·어휘 관련도와 의미적 가속도로 점수화한 뒤 의미 유사도·순차 인접성으로 연결된 하이브리드 그래프에서 질의-유도 관련도를 전파해 응집력 있는 스팬을 선택한다. 5개 장문맥 QA 태스크에서 4배 작은 압축 예산으로도 최강 베이스라인과 동등한 성능을 낸다.
    • 관련 주제: Long-context
  • UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational Memory (2608.30508) — 기존 장기 대화 메모리 벤치마크가 대부분 개별 사실 회상만 측정한다고 지적하고, 분산·암묵적·잡음 섞인 증거를 통합해야 하는 "메모리 활용" 능력을 5개 도메인 1,717개 인스턴스로 진단한다. 사실 회상 벤치마크 성능이 메모리 활용 성능으로 신뢰성 있게 전이되지 않는다는 발견.
    • 관련 주제: Long-context
  • CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration (2608.30295) — 일부 어텐션 헤드가 어텐션 패턴에서 순차적 일관성을 보인다는 관찰에서, 변동계수 기반 알고리즘으로 이런 헤드를 식별해 핵심 토큰만 KV 캐시에 남기고 적응적 헤드는 대부분 유지하는 하이브리드 KV 캐시 방법을 제안. 정확도를 유지하며 메모리 최대 2.72배 절감, 단일 샘플 디코딩 2.18배 가속.
    • 관련 주제: Long-context

Reasoning

  • Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence (2608.31075) — 검증 가능한 보상(RLVR)이 수학·코드를 넘어 개방형·에이전틱 과제로 확장될 때 인간 감독이 학습 루프에서 점차 빠지는 과정을 보상 축(인간 판단→재사용 가능 검증기→무감독 보상)과 경험 축(인간 큐레이션 과제→자기생성 커리큘럼→자율 공진화)의 L0~L4 5단계 사다리로 정리한 포지션 논문. 보상 해킹·피드백 드리프트·커리큘럼 붕괴 등 위험을 함께 짚는다.
    • 관련 주제: Reasoning, AI Scientist / Automated Research
  • Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression (MIST) (2608.31066) — CoT 압축을 위한 토큰 중요도를 외부 스코어러 대신 모델 내부 잔차 스트림에서 직접 읽어낸다. 토큰의 내부 기여를 제거했을 때 답 확률이 얼마나 떨어지는지(necessity)와 그 기여만 남겼을 때 얼마나 오르는지(sufficiency)를 결합해 4개 추론 벤치마크·4개 모델에서 베이스라인을 일관되게 상회.
    • 관련 주제: Reasoning
  • HSRM: Hidden-State Reward Models for Test-Time Verification (2608.30841) — 텍스트를 다시 읽는 기존 검증기 대신, 생성기의 동결된 은닉 상태를 추론 스텝 경계에서 추출해 작은 트랜스포머 인코더로 후보를 순위화하는 경량 hidden-state reward model. 55M 파라미터 텍스트 전용 검증기와 4개 수학 추론 벤치마크의 16개 세팅 중 15개에서 대등하거나 상회하면서 파라미터 수는 약 2M에 불과.
    • 관련 주제: Reasoning

Paper Radar 채택2보류3탈락4

조회 800건 · 신규 734건 · 채택 2 · 보류 3 · 탈락 4

채택

  • PaperGym — Rubric-Centered Evolution for Research-Plan Generation
    • arXiv: 2608.31119
    • 통과 근거: Gate B-2 — 논문을 구조적으로 분리(Goal+Background→질문, Method+Design→답변·rubric)해 criterion leakage를 3.7%로 낮춘 학습 환경과, rubric을 self-distillation teacher context + GRPO reward로 이중 재사용하는 레시피(PaperGym-20k, PaperGym-Innov/Design)를 공개해 우리 재현 파이프라인의 보상 설계에 바로 투입 가능
    • 파일: 2026/2026_PaperGym_Rubric-Research-Plan-RL_arXiv2608.31119.pdf · 리뷰: 2026/2026_PaperGym_Rubric-Research-Plan-RL_arXiv2608.31119_리뷰.md
  • AAR (Automated Alignment Researchers) — Automated Researchers Can Reliably Mitigate Alignment Failures
    • arXiv: 2608.28945
    • 통과 근거: Gate B-1/B-3 — 정렬 연구 자체를 자동화한다는 새 문제 축을 열고, 자율 연구 에이전트가 8시간 작업한 숙련 연구자 28명의 제안을 평균 6.4시간 내에 능가한다는 실증 결과(Fig. 6, 7)로 "전문가 가이드가 필요하다"는 통념(human-guided research direction이 도움 안 됨, Fig. 8)을 뒤집음. 게임 방지 하네스 설계(숨겨진 held-out, 코드-대-작성 일치성 모니터)도 재현 파이프라인의 평가 신뢰도 문제에 참고 가치가 큼
    • 파일: 2026/2026_AAR-Alignment_Automated-Alignment-Researchers_arXiv2608.28945.pdf · 리뷰: 2026/2026_AAR-Alignment_Automated-Alignment-Researchers_arXiv2608.28945_리뷰.md

보류

  • Learning to Evaluate Before Improving (AutoSciRub)2608.31076 — Gate A(자율 연구 에이전트) 통과하나 Gate B 애매: 실행 전 task-specific rubric을 유도해 자율 연구 에이전트의 실행·검증·수정을 가이드하는 방식이 이미 코퍼스에 있는 Autorubric·RubricsSurvey류 rubric 기반 평가와 겹치는 부분이 커, "가이드 메커니즘"이 충분히 새로운 축인지 판단이 서지 않음
  • Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks2608.30047 — Gate A 통과하나 Gate B 애매: exploration→exploitation 국면 전환에 따른 창의성 감쇠라는 관측은 흥미로우나, 정적 아이디어 품질 평가(TasteGap, DivAlign)를 넘어서는 "과정 동역학" 측정이 코퍼스 대비 얼마나 새 문제 축을 여는지 확신이 서지 않음
  • Ideation Arena2608.29696 — Gate A 통과하나 Gate B 애매: 105명 연구자·6,000+ 페어 비교라는 규모는 크지만, 이미 코퍼스에 있는 LigBench(pairwise human-aligned idea benchmark)·TasteGap(human-LLM gap)과 battle-style human 비교라는 핵심 프레임이 겹쳐 새 문제 축인지 불확실

탈락

  • Perceive to Hypothesize, Verify to Ground (GeoPAVE)2608.29880 — Gate A 탈락: 핵심 기여가 지리적 위치추정(geo-localization) 도메인 응용 시스템이며 "가설화·검증"은 이 특정 태스크를 풀기 위한 프레이밍일 뿐 연구 자동화·가설 생성 자체가 목적이 아님
  • Detect Before You Attribute (DUOTRACE)2608.29646 — Gate A 탈락: 범용 멀티에이전트 실패 귀인(이상탐지 필터+기존 귀인 기법 보강) 논문으로 평가도 일반 에이전트 태스크 위주, 연구자동화·가설생성과 무관 — 어제 탈락한 DoCtOR과 동일한 사유
  • Towards a Systems Foundation for Agentic Skills2608.29596 — Gate B 평가 없이 즉시 탈락: 범용 "agentic skills" 생태계에 대한 시스템 아키텍처/서베이 성격 논문이며, 핵심 3토픽(자율연구·가설생성·아이디어평가)의 첫 본격 서베이가 아님
  • Extending TotalSegmentator2608.29348 — Gate A 탈락: CT/MR 영상에서 환자·촬영 메타데이터를 예측하는 의료영상 모델로, "automated research pipelines" 언급이 radar 키워드에 우연히 걸렸을 뿐 연구자동화·가설생성과 무관

색인/커서 참고: --wide 조회(cat:cs.AI OR cat:cs.CL OR cat:cs.LG, sortBy=submittedDate) 관측 최상단 published가 2026-08-31T17:59:46Z — 실행 시각(2026-09-02)에 비해 약 이틀 반 뒤처져 있어 색인 지연이 계속되는 것으로 판단, last_run은 실행 시각이 아니라 이번에 실제로 관측된 가장 최신값(2026-08-31T17:59:46+00:00)으로 세팅. seen이 중복 검토를 막아주므로 커서를 보수적으로 유지하는 데 비용은 없다.

지난 호 다시 보기

2026-09-14 기관 11 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-05 기관 1 · arXiv 10 · 채택 0 · 보류 0 · 탈락 0 2026-09-04 기관 6 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-03 기관 3 · arXiv 15 · 채택 2 · 보류 1 · 탈락 4 2026-09-01 기관 2 · arXiv 13 · 채택 0 · 보류 1 · 탈락 1 2026-08-31 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-30 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-29 기관 2 · arXiv 14 · 채택 2 · 보류 0 · 탈락 2 2026-08-28 기관 9 · arXiv 14 · 채택 0 · 보류 0 · 탈락 2 2026-08-27 기관 8 · arXiv 11 · 채택 0 · 보류 0 · 탈락 2 2026-08-26 기관 5 · arXiv 10 · 채택 1 · 보류 0 · 탈락 1 2026-08-25 기관 1 · arXiv 12 · 채택 0 · 보류 0 · 탈락 1 2026-08-24 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-23 기관 2 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-22 기관 4 · arXiv 15 · 채택 0 · 보류 0 · 탈락 2 2026-08-21 기관 5 · arXiv 3 · 채택 0 · 보류 0 · 탈락 4 2026-08-20 기관 2 · arXiv 9 · 채택 2 · 보류 1 · 탈락 0 2026-08-19 기관 2 · arXiv 14 · 채택 1 · 보류 0 · 탈락 3 2026-08-18 기관 1 · arXiv 15 · 채택 2 · 보류 1 · 탈락 0 2026-08-17 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-16 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-15 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-14 기관 4 · arXiv 14 · 채택 2 · 보류 1 · 탈락 3 2026-08-13 기관 3 · arXiv 15 · 채택 1 · 보류 1 · 탈락 0 2026-08-12 기관 2 · arXiv 11 · 채택 0 · 보류 0 · 탈락 1 2026-08-11 기관 1 · arXiv 13 · 채택 0 · 보류 0 · 탈락 6 2026-08-10 기관 0 · arXiv 0 · 채택 10 · 보류 0 · 탈락 0 2026-08-09 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-08 기관 8 · arXiv 14 · 채택 2 · 보류 1 · 탈락 4 2026-08-07 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-06 채택 0 · 보류 0 · 탈락 0 2026-08-04 채택 2 · 보류 3 · 탈락 9