Daily Update

바쁜 아침에 대신 읽어드리는 자율 연구 소식

리서치 레이더

2026년 9월 3일 (목) 기관 3 · arXiv 15 · 채택 2 · 보류 1 · 탈락 4

기관 리서치

Google DeepMind

  • Proactive Cyber Defense for Governments and Enterprises — ⚠ 본문 확인 실패: 원문이 blog.google로 리다이렉트되는데 해당 도메인이 egress 정책에 막혀 있어 제목·게시일(2026-09-02)만 확인함. — 링크
    • 관련 주제: 없음(본문 미확인)
  • Introducing Gemini 3.8 Flash and 3.8 Flash Cyber — ⚠ 본문 확인 실패: 위와 동일한 사유(blog.google 리다이렉트 차단)로 제목·게시일(2026-09-02)만 확인함. — 링크
    • 관련 주제: 없음(본문 미확인)

Google Research

  • 신규 없음 (RSS 최신 글은 "Mapping global methane emissions from space with deep learning", 2026-09-01 게시로 이미 어제 브리핑에서 다룬 항목이며 커버 범위 내 후속 게시 없음)

OpenAI

  • 신규 없음 (RSS 최신 항목 "How AI-native companies turn workflows into operating capability"는 2026-09-01 게시에 AI Adoption 카테고리로 Research/Publication 카테고리 신규 항목 없음)

Anthropic

  • 신규 없음 (연구 페이지 최상단 항목이 여전히 "Automated researchers can reliably mitigate alignment failures", 2026-08-28로 커버 범위 이전)

Meta FAIR / Meta AI

  • 신규 없음 (블로그 최신 게시물은 "Introducing Muse Spark 1.1", 2026-07-09로 7월 초 이후 갱신 없음)

Microsoft Research

  • 신규 없음 (RSS 최신 글은 "GigaPath-Flash and GigaTIME-Flash", 2026-08-31로 커버 범위 이전)

NVIDIA Research

  • 신규 없음 (research.nvidia.com/publications는 여전히 컨퍼런스 발표 예정일 기준 정렬이라 신규 판별 불가 — 보조 확인한 blogs.nvidia.com/feed/ 최신 글은 "NVIDIA and CrowdStrike Strengthen Agentic Cybersecurity Frontier", 2026-09-01로 어제 브리핑에서 이미 다룸)

Apple ML Research

  • REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs — 기존 비전-언어-행동(VLA) 모델이 원시 모터 명령을 통째로 생성하는 단일 구조라 여러 단계로 이어지는 과제에서 성능이 떨어지고 재사용 가능한 스킬로 조직되지 못한다는 문제를 지적. 학습된 잠재 세계모델의 결과를 기준으로 모터 프로그램 구간을 군집화하는 "수면" 단계와, Hindley–Milner 타입 시스템 어휘의 타입드 람다항을 생성해 정류흐름(rectified-flow) 디코더로 행동을 만드는 "각성" 단계를 번갈아 도는 wake/sleep 구조를 제안한다. LIBERO 벤치마크에서 세계모델을 1.88억→4.3억 파라미터로 키우면 오히려 전 스위트 성능이 저하되는 반면, InfoNCE 대조 손실을 세계모델 학습에 추가하면 스킬 군집화 품질(정규화 상호정보량)이 Spatial 스위트 0.867, Goal 스위트 0.915까지 개선됨을 보인다. — 링크
    • 관련 주제: 없음(로봇 모터 스킬 학습)

arXiv 신규

AI Scientist / Automated Research

  • Can LLMs Discover Scientific Laws in Real and Parallel Worlds? (SCILAWS-BENCH) (2609.01552) — 발표된 논문·실측 데이터를 기반으로 한 과학 법칙 발견 벤치마크를 제안한다. 381편 논문에서 뽑은 118개 문제(291개 후보 법칙, 약 800만 개 실측 데이터)로 구성되며, 고정된 실측 관측에서 법칙을 제안하는 REAL 설정과 잔차 보정된 가상 세계를 능동적으로 질의해 숨겨진 법칙을 복원하는 PARALLEL 설정으로 나뉜다. 예측 적합도와 과학적 타당성이 종종 어긋나고 암기 여부가 모델이 기존 공식을 넘어서는지를 좌우하며, best-of-N 실험에서 선택 병목이 드러난다.
    • 관련 주제: AI Scientist / Automated Research, Hypothesis Generation
  • EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation (2609.01526) — LLM 기반 과학 에이전트가 가설을 자유 텍스트로만 표현해 검증·수정이 어렵다는 문제에, 명시적 구조적 인과모델(SCM)이 실험 증거에 따라 진화하는 EvoSCM을 제안한다. 여러 경쟁 SCM 가설 집단을 유지하며 잠재 메커니즘을 귀추적으로 추정하고 판별력 있는 개입을 설계해 반증 가능한 예측을 검증하는 폐루프 발견 사이클을 돈다. 숨은 물리 역학을 실험으로 밝혀내야 하는 DiscoverPhysics 벤치마크에서 베이스라인 대비 일관되게 더 정확한 설명·예측을 낸다.
    • 관련 주제: AI Scientist / Automated Research, Hypothesis Generation
  • Autonomous discovery of new structure-plausibility laws for explainable and rapid crystal diagnosis and screening (PRIS) (2609.01209) — 결정 구조 생성기·도구사용 에이전트가 후보 구조를 DFT 계산보다 훨씬 빠르게 쏟아내면서 어떤 후보를 검증할지가 병목이 된 문제에, 에이전트가 200만 개 후보 법칙을 생성·능동 반증해 무기물 구조 타당성 규칙 8개(PRIS)를 도출한다. 실험 구조의 82~99%가 이 법칙을 만족하는 반면 Pauling 규칙 2~5는 6.5%만 동시 만족했고, 손상된 결정 구조의 87.9%를 탐지(거리 컷오프는 1.6~3.2%)하며, 역설계 파이프라인에서 DFT 검증 큐를 최대 67.3% 줄인다.
    • 관련 주제: AI Scientist / Automated Research
  • Dr. Claw: An AI Scientist Workspace for Vibe Research (2609.00365) — 명령줄 코딩 에이전트(Claude Code, Gemini CLI 등)가 파일을 읽고 쓰며 장시간 세션을 유지할 수 있게 됐지만, 엔드투엔드 연구는 여전히 채팅·IDE·터미널·집필 환경으로 파편화되고 감사 가능한 의사결정이 남지 않는다는 문제를 다룬다. 오픈소스 워크스페이스 Dr. Claw는 기존 코딩 에이전트 실행기를 또 다른 자율 에이전트로 대체하는 대신, 지속 상태 객체·재사용 스킬 라이브러리·다중 실행기 조율로 감사·복구 가능한 하나의 루프로 묶는다. 같은 백엔드 실행기를 공유하는 순정 커맨드라인 에이전트 대비 연구 완결성 점수가 더 높았다.
    • 관련 주제: AI Scientist / Automated Research, AI Agents

Hypothesis Generation

  • Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents (HypoSearch) (2609.01294) — 딥리서치 에이전트가 하나의 진화하는 탐색 궤적만 따라가다 초기 방향이 잘못되면 이후 도구 호출이 같은 경로를 계속 강화하는 실패 양상을 궤적 단위 분석으로 밝힌다. 성공 궤적은 모호한 탐색을 구체적 후보로 접지하고 현재 경로가 약할 때 방향을 전환하는 두 행동을 보였고, 이를 바탕으로 가벼운 가설을 소프트 힌트로 생성해 제한된 독립 분기로 탐색한 뒤 분기 단위 증거를 비교하는 HypoSearch를 제안한다. 4개 딥리서치 벤치마크·3개 백본 모델에서 단일 궤적 탐색과 표준 병렬 베이스라인을 일관되게 능가하며, Qwen3.5-122B를 BC-small에서 46.7→60.0으로 끌어올리면서도 도구 호출 수는 5개 독립 궤적보다 적었다.
    • 관련 주제: Hypothesis Generation, AI Agents
  • Can Large Language Models Forecast What Researchers Study Next? (IdeaForecastBench) (2609.00747) — LLM이 연구 아이디어를 생성할 때 참신성·타당성을 그 시점에 판단하는 것과, 실제로 이후 문헌에서 그 방향을 예견했는지는 다른 문제라는 점에서 출발해, 특정 시점까지의 문헌이 주어졌을 때 이후 논문과 대조해 평가하는 IdeaForecastBench(52개 주제, 624개 롤링 에피소드)를 제안한다. GPT-4.1·Qwen2.5-7B/14B·Qwen3.5-9B에 5가지 이력 압축 전략과 학습된 Mode-Decomposition Forecaster를 비교한 결과, 요약(Summary) 압축이 직접 제시(Direct) 대비 Hit@5·Precision@5를 일관되게 개선했고 Qwen2.5가 GPT-4.1보다 높은 점수를 냈다.
    • 관련 주제: Hypothesis Generation, AI Scientist / Automated Research

AI Agents

  • Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement (2609.01481) — 고수준 요구사항을 사람 개입 없이 완전한 소프트웨어로 바꾸는 자율 소프트웨어 개발에서, 기존 코딩 에이전트 하네스를 계획-코딩-테스트 반복 루프로 조직해 지속적으로 개선하는 Harness-of-Harness(HoH)를 제안한다. 수리와 역량 성장을 균형 있게 배분하고 검증 가능한 소규모 증분으로 개발을 제한하며 구현 시점 테스트와 독립 평가를 분리하는 설계로, 3개 벤치마크·3개 하네스-모델 조합에서 평균 52.25%, 최대 82.86%의 상대적 성능 향상을 보였다. 70회 이상 반복이 이어진 다일간 배포 실험에서는 완전한 1인칭 슈팅 게임을 스토리·핵심 메커닉·시각효과·오디오까지 자율적으로 개발했다.
    • 관련 주제: AI Agents
  • HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? (2609.01437) — 에이전트가 배포될 때 성능이 모델 가중치뿐 아니라 실행 인프라인 '하네스'에 크게 좌우된다는 점에서, 평가 단위를 태스크 산출물에서 실행 가능한 인프라 자체로 옮긴 벤치마크 HarnessDev를 제안한다. 최소 시드에서 완전한 실행 시스템을 구축하는 Creation 단계와 만든 하네스를 실행 피드백으로 반복 개선하는 Evolution 단계로 나뉘며, 6개 생성 LLM·4개 도메인·5개 다운스트림 벤치마크(2,207개 인스턴스)로 평가한다. 생성된 하네스는 코드·검색/리서치 영역에서 사람이 설계한 성숙한 레퍼런스에 크게 못 미쳤지만 글쓰기·머신러닝 실험 영역에서는 대등하거나 앞섰고, Evolution의 개선 효과는 불안정하며 실행 모델을 바꾸면 전이가 제한적이었다.
    • 관련 주제: AI Agents
  • Self-Reports Are Not Verification: Environment-Grounded Auditing of LLM Operators in Evolutionary Search (2609.00652) — 에이전트가 스스로 제안·관찰·설명을 모두 수행할 때 자기 보고(확신도·근거 서술)를 모니터링 신호로 쓰는 관행이 편리하지만 검증은 아니라는 문제의식에서, 모든 중간 제안에 정확한 결과가 주어지는 환경 기반 감사를 진화 탐색(evolutionary Contexto search) 위에서 수행한다. 5개 설정·3개 모델군에 걸친 200회 실행, 12,249건의 자기 보고를 분석한 결과 확신도의 보정성·이전 근거의 영향·적합도 기반 선택이 보고 품질을 높인다는 세 가정이 모두 기각됐고, 연산자는 상위 100위 성공률을 4.8~9.3배 과대 보고했다.
    • 관련 주제: AI Agents, Reasoning

Long-context

  • LatentPress: Context Compression Beyond Text and Vision (2609.01507) — 압축된 컨텍스트가 사람이 읽는 텍스트나 다시 디코딩해야 하는 렌더링 이미지로 전달되는 관행 대신, 동결된 디코더가 입력 임베딩 계층에서 바로 읽는 연속 메모리 토큰이라는 제3의 표현으로 대화 이력·장문서를 압축하는 LatentPress를 제안한다. 리더와 짝지어진 소형 라이터만 학습(전체 파라미터의 약 0.1%)해 4~16배 압축을 달성하며, LongMemEval에서 7.70배 압축으로 0.504의 정확도를 얻어 비압축 근거(0.490)·텍스트 요약(0.184)·OCR 기반 압축(0.426~0.312)을 모두 능가하고, 쓰기는 대화당 43ms로 텍스트 요약·OCR 재구성보다 한 자릿수 이상 빠르다.
    • 관련 주제: Long-context
  • CacheBridge: Efficient Cross-Model KV Cache Transfer (2609.00891) — 다중 모델 시스템에서 컨텍스트를 공유하려면 KV 캐시가 모델별로 달라 수신 모델이 공유 프리픽스를 다시 프리필해야 하는 문제에서, 기존 학습 없는 폐형 아핀 매퍼(Full-Head Mapping)가 대상 모델의 각 KV 헤드를 선택된 레이어의 모든 소스 헤드로부터 매핑해 아키텍처 차이에 민감하고 저장·적용 비용이 커진다는 한계를 지적한다. CacheBridge는 대상 헤드를 일치하는 소스 헤드 하나로만 제한하고 인과적 어텐션 민감도로 재구성 오차에 가중치를 줘, Qwen3 14B→32B 전이에서 매퍼 저장 공간을 8배 줄이고 적용을 최대 3.0배 가속하며 500-시퀀스 구성 시간을 92.63초에서 8.63초로 단축한다.
    • 관련 주제: Long-context
  • MemoryWalker: Stop Training Agents on Contexts They Never Saw (2609.00865) — Claude Code·Qwen-Agent 같은 프로덕션 에이전트 하네스가 롤아웃 중 컨텍스트를 압축하는데, 압축 상태로 학습하면 매 축출(eviction)이 이력을 트리로 분기시켜 학습 대상이 시퀀스가 아닌 트리가 되는 조건화 문제가 생긴다는 것을 지적한다. 세그먼트 K-순방향 순회(LogitTree)와 4D 어텐션 마스크라는 두 가지 정확한 그래디언트 동치 교정과, 단일 역전파로 압축 학생과 압축 전 프리픽스에 대한 정지-그래디언트 교사 사이 순방향 KL을 최소화하는 SDCC를 제안한다. 7개 웹 검색 벤치마크에서 순진한 학습은 롤아웃 로그확률 격차를 키우는 반면 정확한 방법은 무압축 하한을 유지하고 SDCC는 그 격차를 상당히 줄인다.
    • 관련 주제: Long-context, AI Agents

Reasoning

  • Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR (2609.01354) — RLVR와 벤치마크 평가 모두 자유 텍스트 답을 이진 보상으로 바꾸는 자동 검증기에 의존하는데, 기존 연구가 "검증기가 자기 정답의 94%만 수용한다"는 집계 수치만 보고하고 어떤 답 형식이 오류 예산을 소모하는지는 밝히지 않았다는 점을 지적한다. 검증기 자체에 메타모픽 테스트를 적용해 수학적으로 동치인 답 변형을 생성하고 4개 주요 검증기·307,420건의 판정을 답 범주별로 분해한 결과, 동일 입력에 대한 자기 검증 일치율이 53.8~95.2%로 41.3점 차이가 났고 오류의 93.0%가 공백·구두점 범주에 집중됐으며, 참조 수치 캐스케이드는 크기 임계값을 넘으면 오답도 100% 수용하는 계단 함수적 결함을 보였다.
    • 관련 주제: Reasoning
  • Cheap Verifiers, Large Blind Spots: Measuring the Reliability Cost of Cost-Saving Cascades (2609.01345) — 저렴한 모델이 대부분의 질의에 답하고 어려운 꼬리만 프론티어 모델(검증기)로 에스컬레이션하는 추론 캐스케이드에서, 검증기가 거부한 사례로 저렴한 학생을 미세조정해 에스컬레이션률을 라운드마다 낮추는 자기개선 루프를 실측한다. 검증기의 사각지대(학생의 오답을 수용하는 비율)는 학생 역량이 커질수록 커지고(β 0.12→0.55) 검증기 역량이 커질수록 작아지지만, 프론티어급 검증기조차 어려운 MATH 질의의 46%를 실제 오류율 39%보다 높게 에스컬레이션한다. 나이브한 교정 미세조정은 학생을 개선하지 못하고 오히려 붕괴시켜, 캐스케이드 자체의 대시보드가 실제 오류가 최대 32%까지 치솟아도 3%로 읽히는 구조적 맹점을 이론과 실험으로 규명한다.
    • 관련 주제: Reasoning
  • From Base Rollouts to RL Reasoning: A Budgeted Search Perspective (2609.01274) — 검증 가능 보상 기반 RL(RLVR)이 언어모델 추론을 개선하는 이유가 베이스 모델에 없던 추론을 새로 만들어내서인지, 아니면 베이스 모델이 이미 도달 가능하지만 잘 샘플링하지 않던 궤적 쪽으로 롤아웃 분포를 옮기는 것인지를 행동적으로 규명한다. 토큰 단위 샘플링부터 트리 탐색까지를 하나의 예산 인지 연산 공간으로 표현하는 통합 디코딩 프레임워크(UDF)로 Base/RL 짝지은 체크포인트를 비교한 결과, RL의 pass@k 곡선을 베이스 모델의 구조화된 탐색 경로(BOPTR, N_Base≈αN_RL^β)로 근사할 수 있었고 Qwen2.5-7B에서 전이 오차 3.41pp를 기록하며 10개 모델·4개 벤치마크로 일반화됨을 확인, RL 이득의 상당 부분이 파라미터 수준의 새 능력이 아니라 탐색 효율의 변화임을 시사한다.
    • 관련 주제: Reasoning

Paper Radar 채택2보류1탈락4

조회 600건 · 신규 438건 · 채택 2 · 보류 1 · 탈락 4

채택

  • SciLaws-Bench — Can LLMs Discover Scientific Laws in Real and Parallel Worlds?
    • arXiv: 2609.01552
    • 통과 근거: Gate B-1/B-4 — 118문제·381편 논문·8M 실측 데이터로 "고정 관측 해석(REAL)"과 "능동 실험 설계(PARALLEL)"를 분리 평가하는 새 축의 벤치마크. 암기(cold-recall) 대 발견을 정량 분리하고 best-of-N 선택 병목을 규명 — 기존 코퍼스의 이데이션/검증 벤치마크(AutoResearchEval, LigBench 등)와 겹치지 않는 프레이밍.
    • 파일: 2026/2026_SciLawsBench_Scientific-Law-Discovery-Benchmark_arXiv2609.01552.pdf · 리뷰: 2026/2026_SciLawsBench_Scientific-Law-Discovery-Benchmark_arXiv2609.01552_리뷰.md
  • Dr. Claw — An AI Scientist Workspace for Vibe Research
    • arXiv: 2609.00365
    • 통과 근거: Gate B-2 — 새 자율 에이전트를 만들지 않고 Claude Code류 코딩 에이전트를 감싸 영속적 상태 객체(Task Graph/Artifact Store/Decision Log/Execution Trace)와 스킬 라이브러리로 감사·복구 가능하게 만드는 워크스페이스. 우리 재현 파이프라인(HypoExplore/AutoScientists)도 코딩 에이전트류 실행기 위에서 동작한다는 점에서 즉시 참조 가능한 설계.
    • 파일: 2026/2026_DrClaw_AI-Scientist-Workspace-for-Vibe-Research_arXiv2609.00365.pdf · 리뷰: 2026/2026_DrClaw_AI-Scientist-Workspace-for-Vibe-Research_arXiv2609.00365_리뷰.md

보류

  • Agentic Empirical Asset Pricing: Methodological Foundations — 2609.00731 — "자율 과학적 발견 프로세스" 평가 방법론을 표방하지만 자산가격결정(금융) 버티컬에 강하게 결박되어 있어, 일반 방법론적 기여인지 도메인 응용인지 애매.

탈락

  • Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents — 2609.01294 — 핵심 기여가 웹검색 QA 에이전트의 탐색 전략(가설 유도 분기)이며 과학 실험·가설 검증 파이프라인이 아님.
  • Autonomous discovery of new structure-plausibility laws for explainable and rapid crystal diagnosis and screening — 2609.01209 — 핵심 기여가 결정구조 스크리닝이라는 재료과학 도메인 성과이고 에이전트는 생성-검증-반박 도구로만 쓰임.
  • DualStake: Dual-Path Confidence Calibration in Deep Research Agents — 2609.00935 — 딥리서치(QA) 에이전트의 신뢰도 보정 방법론으로 AI-Scientist/가설생성과 무관.
  • Autoresearch for Marketplace Catalogs: From Legacy Forms to AI-Native Matching — 2609.00274 — 제목에 "Autoresearch"가 들어가지만 실제 내용은 상업 마켓플레이스 카탈로그 생성 응용이며 키워드 우연 매칭.

참고: 색인 상태

넓은 조회(--wide, cs.AI/cs.CL/cs.LG) 최상단 published는 2026-09-01T17:59:49Z로 실행 시각(2026-09-02T22:45 UTC) 기준 "어제"에 해당해 색인 지연 없이 정상으로 판단. 커서는 실행 시각으로 전진.

지난 호 다시 보기

2026-09-14 기관 11 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-05 기관 1 · arXiv 10 · 채택 0 · 보류 0 · 탈락 0 2026-09-04 기관 6 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-02 기관 3 · arXiv 15 · 채택 2 · 보류 3 · 탈락 4 2026-09-01 기관 2 · arXiv 13 · 채택 0 · 보류 1 · 탈락 1 2026-08-31 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-30 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-29 기관 2 · arXiv 14 · 채택 2 · 보류 0 · 탈락 2 2026-08-28 기관 9 · arXiv 14 · 채택 0 · 보류 0 · 탈락 2 2026-08-27 기관 8 · arXiv 11 · 채택 0 · 보류 0 · 탈락 2 2026-08-26 기관 5 · arXiv 10 · 채택 1 · 보류 0 · 탈락 1 2026-08-25 기관 1 · arXiv 12 · 채택 0 · 보류 0 · 탈락 1 2026-08-24 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-23 기관 2 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-22 기관 4 · arXiv 15 · 채택 0 · 보류 0 · 탈락 2 2026-08-21 기관 5 · arXiv 3 · 채택 0 · 보류 0 · 탈락 4 2026-08-20 기관 2 · arXiv 9 · 채택 2 · 보류 1 · 탈락 0 2026-08-19 기관 2 · arXiv 14 · 채택 1 · 보류 0 · 탈락 3 2026-08-18 기관 1 · arXiv 15 · 채택 2 · 보류 1 · 탈락 0 2026-08-17 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-16 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-15 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-14 기관 4 · arXiv 14 · 채택 2 · 보류 1 · 탈락 3 2026-08-13 기관 3 · arXiv 15 · 채택 1 · 보류 1 · 탈락 0 2026-08-12 기관 2 · arXiv 11 · 채택 0 · 보류 0 · 탈락 1 2026-08-11 기관 1 · arXiv 13 · 채택 0 · 보류 0 · 탈락 6 2026-08-10 기관 0 · arXiv 0 · 채택 10 · 보류 0 · 탈락 0 2026-08-09 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-08 기관 8 · arXiv 14 · 채택 2 · 보류 1 · 탈락 4 2026-08-07 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-06 채택 0 · 보류 0 · 탈락 0 2026-08-04 채택 2 · 보류 3 · 탈락 9