Daily Update

바쁜 아침에 대신 읽어드리는 자율 연구 소식

리서치 레이더

2026년 8월 12일 (수) 기관 2 · arXiv 11 · 채택 0 · 보류 0 · 탈락 1

기관 리서치

Google DeepMind

  • 신규 없음 — RSS(deepmind.google/blog/rss.xml) 확인. 최신 게시물은 여전히 8/6 "WeatherNext: AI model achieves breakthrough in forecasting cyclones"로, 이미 다룬 항목입니다.

Google Research

  • Advancing AMIE towards expert-level audio-visual clinical consultations (2026-08-11) — Gemini/Project Astra 기반 멀티에이전트(Talker·Planner·Perception 3개 에이전트가 병렬로 대화 유지·임상 추론·음성/영상 지각을 분담)로 실시간 화상 진료를 수행하는 AMIE (Video)를 발표. 30명 1차진료의·15명 환자 배우·100개 시나리오의 무작위 OSCE 연구(300회 진료)에서 병력청취·진단·관리·의사소통 전반이 정식 의사와 대등하다는 평가를 받았고, 신체 소견 관찰·진찰 유도 항목에서는 의사와 텍스트 전용 AMIE보다도 높게 평가됐습니다. arXiv 버전도 동시 게재(2608.09861). — 링크
    • 관련 주제: AI Agents

OpenAI

  • 신규 없음 — RSS(openai.com/news/rss.xml)를 Research/Publication 카테고리로 필터링. 최신 항목은 여전히 8/1 "Ten advances in mathematics and theoretical computer science"(Publication)입니다.

Anthropic

  • 신규 없음 — 이번 실행에서는 www.anthropic.com/research가 정상 응답했습니다(직전 며칠간의 egress 차단이 이번엔 재현되지 않음). 페이지에 나열된 게시물 중 가장 최근 항목은 여전히 8/10 "Learning more about Claude's mathematical capabilities"(Riemann zeta, 어제 브리핑에서 이미 다룸)이며, 그 이후 새 글은 없습니다.

Meta FAIR / Meta AI

  • 신규 없음 — 블로그 페이지(ai.meta.com/blog/) 확인(RSS 없음). 최신 게시물은 여전히 7/27 "Reimagining Independence: How Meta's AI Models Are Helping the University of Pittsburgh Transform Assistive Robotics"로 커버 범위 밖입니다.

Microsoft Research

  • Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement (2026-08-11) — 방사선 VLM이 보정된 신뢰도 없이 텍스트만 생성하고, 심각도와 무관하게 모든 오류를 동일하게 벌점 주며, 심장비대 같은 진단에 필요한 정밀 계측을 못 하는 세 가지 한계를 지적. 분류/그라운딩 보조 헤드를 단 이중 추론 구조 + DAPO 기반 RL + 툴 증강 계측을 결합해, MIMIC-CXR 등 4개 벤치마크에서 최고 CRIMSON 점수, ReXVQA 1위(정확도 94%), 계측 과제에서 지각-전용 방법 대비 F1 평균 +43.6점을 기록. — 링크
    • 관련 주제: 5개 주제 직접 해당 없음

NVIDIA Research

  • 신규 없음(주제 무관) — blogs.nvidia.com/feed/의 8/11 신규 글(전력 아키텍처, Nemotron 3.5 Lightning/NeMo Switchyard 모델·라우터 출시)은 모두 제품/인프라 발표이며 연구 블로그 포스트가 아닙니다. research.nvidia.com/publications도 확인했으나 개별 항목에 신뢰할 만한 게시일이 없어(과거 실행에서도 동일하게 확인된 문제) 커버 범위 내 신규 여부를 판단할 수 없었고, 표시된 항목 중 5개 주제와 명확히 겹치는 것도 없었습니다.

Apple ML Research

  • 신규 없음 — RSS(machinelearning.apple.com/rss.xml) 확인. 최신 게시물은 여전히 8/7 "Scaling Categorical Flow Maps"로, 이미 다룬 항목입니다.

arXiv 신규

색인 지연 참고: 넓은 조회(300건)의 게재 시각 범위는 2026-08-09 21:28 UTC ~ 2026-08-10 17:59 UTC로, 어제 브리핑이 이미 다룬 상한(2026-08-10 16:06 UTC)보다 약 2시간 뒤까지만 전진했습니다. arXiv가 오늘(8/11 KST 기준) 치 신규 배치를 아직 공지하지 않은 것으로 보이며, 이는 신규가 없다는 뜻이 아니라 색인이 아직 안 닿았다는 뜻입니다(Paper Radar도 같은 현상을 관측 — 3절 참고). 실질적으로 어제 이후 진짜 신규인 구간(2026-08-10 16:06~17:59 UTC, 약 2시간)의 36건만 검토했습니다.

AI Agents

  • SHE: Trajectory-driven Safety Harness Evolution for LLM Agents (2608.09885) — 에이전트 안전이 모델 가중치뿐 아니라 컨텍스트·메모리·툴·권한을 관리하는 하네스에도 달려 있는데 기존엔 하네스를 고정된 배포물로 취급하는 문제를, 하네스를 시스템 프롬프트·규칙뱅크·안전메모리·툴정책 4개 아티팩트로 분해해 롤아웃 실패를 구조화된 진단으로 바꾸고 국소적으로 진화시키는 프레임워크로 다룬다. Agent-SafetyBench에서 정적 SafeHarness 대비 공격성공률(ASR) 3.1배 감소를 보였고, 별도 AgentHarm 벤치마크와 다른 에이전트 모델로도 일반화·전이됐다.
    • 관련 주제: AI Agents
  • Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy (2608.09857) — 로봇 자율주행 연구가 실행에만 집중하고 플래닝 모델이 제안한 행동의 타당성 검증은 소홀히 하는 문제에, 플래닝과 실행 사이에 LLM-as-a-Judge 앙상블(여러 모델의 CoT를 합성, mixture-of-experts+self-consistency 결합)로 승인/재구성/인간 에스컬레이션을 판정하는 검증 계층을 미들웨어로 끼워 넣었다. 승인/에스컬레이션/거부 3분류에서 약 85% 정밀도, 적대적 공격 97% 차단을 달성했고 오류는 주로 에스컬레이션 경계에서만 발생했다.
    • 관련 주제: AI Agents
  • Multi-Agent AI Safety as an Institutional Design Problem (2608.09828) — 멀티에이전트 시스템의 안전 원천을 규칙 자체가 아니라 위임·권한·차단 후 경로를 다스리는 "제도"의 구조에서 찾는 POLIS 연구 프로그램의 첫 논문. 5,280 에피소드 실험에서 상세한 헌법적 프롬프트와 출처 인식(provenance-aware) 가드는 각각 0/384 위반이었지만, 로컬 상태 기반 가드는 매칭된 "세탁(laundering)" 시나리오에서 22/96 위반(출처 인식 가드는 0/96, p=4.77×10⁻⁷)을 보여 최종 위반율이 같아도 메커니즘이 크게 다를 수 있음을 보였다.
    • 관련 주제: AI Agents
  • CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems (2608.09848) — 상용 게임엔진에 갇힌 저수준 반응 제어와, 가상 세계에 구현하기 어려운 고수준 추론 모델 사이의 간극을 메우기 위해 Sense-Think-Act와 Belief-Desire-Intention을 결합한 모듈형 인지 아키텍처를 제안한다. 실시간 인터랙티브 3D 환경에 배치 가능한 재사용형 템플릿을 목표로 하나, 정량 평가는 포함하지 않은 아키텍처 제안 단계 논문이다.
    • 관련 주제: AI Agents

AI Scientist / Automated Research

  • Agentic Auto-Research is Fuzz Testing (2608.09855) — 자율 연구 에이전트가 실험을 검증 속도보다 빠르게 만들어내는 문제를, "생성 후 순위매김"이 아니라 그레이박스 퍼저처럼 매 실행마다 저비용의 조밀한 진행 신호를 얻고 그 신호로 다음 개입을 정하는 탐색 문제로 재정의해야 한다고 주장한다. 다만 실험 결과 없이 향후 검증할 controlled test만 제안하는 포지션 페이퍼다(같은 이유로 Paper Radar에서도 탈락 — 3절 참고).
    • 관련 주제: AI Scientist / Automated Research, AI Agents
  • ArchAgent v2: A Case Study with the Data Prefetching Championship (2608.09874) — 단일 캐시 교체 정책만 다루던 기존 ArchAgent를 멀티레벨 데이터 프리페칭으로 확장, 캐시 레벨별로 순차 진화·고정하는 계단식 진화 탐색과 하드웨어 실현가능성 피드백 루프를 더했다. 4th Data Prefetching Championship(DPC4) 규칙 그대로 평가해 기존 우승작(BertiGO) 대비 IPC 3.8% 향상(저대역폭 단일코어에서는 4.6% vs 2.6%)을 달성, 12,000개 이상의 후보 설계 프로파일링으로 자동화 에이전트가 챔피언십급 하드웨어 설계를 넘어설 수 있음을 보였다.
    • 관련 주제: AI Scientist / Automated Research, AI Agents

Reasoning

  • Consilience for Verifier-Free Test-Time Scaling (2608.09898) — 외부 검증기 없이 신뢰도만으로 롤아웃 순위를 매기는 verifier-free test-time scaling이 복잡한 과제에서 "균일하게 높은 신뢰도가 오히려 탐색 실패와 자신만만하게 틀린 답을 가리킨다"는 현상을 보이며 무너지는 것을 지적한다. 초반엔 낮은 신뢰도로 탐색적으로 분기하고 후반엔 높은 신뢰도로 수렴하는 패턴을 요구하는 consilience 선택 프레임워크로 대학원 수준 수학·자유형 코드 생성에서 기존 신뢰도 기반 베이스라인을 능가했다.
    • 관련 주제: Reasoning
  • BDH-CQ: In-Context Learning with Recurrent Latent Reasoning (2608.09888) — 추론 과정을 언어화하지 않고 고차원 잠재공간의 반복 계산으로 문제를 푸는, 인컨텍스트 학습과 순환 잠재 추론을 결합한 모델이다. ARC-AGI-1 평가에서 1.5억 파라미터 구성으로 pass@2 29.5%·태스크당 $0.0007을 달성해 기존에 보고된 비용-정확도 파레토 프론티어를 돌파했다.
    • 관련 주제: Reasoning
  • Stealing Reasoning Traces from Proprietary LLM APIs (2608.09867) — 주요 LLM 제공사가 CoT를 서버가 아닌 클라이언트에 암호화 블록으로 돌려주는데, 이 블록이 같은 제공사 생태계 내 세션·사용자·모델 간에 서로 호환된다는 아키텍처 취약점을 발견했다. 더 강한 모델의 암호화 트레이스를 안전장치가 약한 모델에 주입해 평문으로 디코딩시키는 공격을 Anthropic·OpenAI·Google 전반에서 재현했고, 공개 저장소에서 스크레이핑한 315,320개 블록을 복호화해 PII 367건·자격증명 182건을 복구했으며 겉보기엔 무해한 최종 답변 뒤에 숨은 위험 정보와 비가시적 프롬프트 인젝션 공격까지 시연했다.
    • 관련 주제: Reasoning
  • Mismatch Matters: On-Policy Distillation Beyond Token Agreement (2608.09836) — on-policy distillation에서 학생이 반복 루프로 토큰 일치도만 높이고 응답 품질은 나쁜 "퇴화한 합의(degenerate agreement)"에 빠지는 실패 양상을 지적하고, 학생-초과 토큰과 학생-결핍 토큰을 구분해 각각 bounded Hellinger 보정과 teacher top-K 주입으로 다루는 TIDE를 제안한다. 여러 Qwen3 teacher-student 조합의 수학 추론 벤치마크에서 표준 OPD를 상회했고, teacher-student 불일치가 심할수록 이득이 커져 Avg@8을 6.9%→20.3%로 끌어올리며 응답 길이도 3.6배 단축했다.
    • 관련 주제: Reasoning
  • Parameter Exploration for RLVR via Variational Learning (2608.09805) — 온도 스케일링 같은 액션 공간 탐색이 토큰 순서를 재배열하지 못하고 출력 분포의 분산만 조절하는 한계를 지적하며, 사후분포에서 서로 다른 정책을 여러 개 샘플링해 롤아웃을 만드는 파라미터 공간 탐색(3PO, Perturbed Parameter Policy Optimization)을 제안한다. OLMo-3-1025-7B·Qwen2.5-Math-7B의 수학·코드 생성 과제에서 동일 FLOPs로 표준 GRPO 대비 일관된 성능 향상과 더 적은 zero-advantage 그룹·오류 롤아웃을 보였다.
    • 관련 주제: Reasoning

Paper Radar 채택0보류0탈락1

조회 200건 · 신규 1건 · 채택 0 · 보류 0 · 탈락 1

색인 지연 감지 및 커서 정정. 정규 수집(fetch.py, since=2026-08-11T02:28:58+00:00, 어제 실행 시각으로 전진시킨 커서)은 신규 0건을 반환했다. 그런데 넓은 브리핑 조회 최상단 게시 시각이 2026-08-10T17:59:51Z로 어제의 last_run(2026-08-11T02:28:58Z)보다 오래되어, 어제 커서가 실제 관측된 데이터보다 앞서 전진해 있었음을 확인했다(색인 지연 상황에서 "10시간 이내"만 보고 실행 시각으로 전진시킨 어제의 판단이 원인). 실제로 좁은 레이더 질의를 직접 재현해 보니 Agentic Auto-Research is Fuzz Testing (2608.09855, 게재 2026-08-10T17:13:02Z)가 어제 커서보다 이전 시각인데도 seen.json에 없어 후보에 오른 적이 없었던 것으로 드러났다.

이를 복구하기 위해 --since 2026-08-08T00:00:00+00:00로 재수집했다(조회 200건은 좁은 질의 특성상 어차피 2026-05-18까지 거슬러 올라가는 동일 페이지라 비용 없음). 신규 1건(2608.09855)만 나왔고 나머지는 모두 이미 seen으로 걸러졌다 — 결측 구간에 다른 후보는 없었다. 이번 커서는 실행 시각이 아니라 이번 피드에서 실제로 관측된 가장 최신 published(2026-08-10T17:59:51+00:00, 넓은 조회 최상단)로 설정한다. 어제보다 뒤로 물러나는 값이지만, seen.json의 판정 기록이 재검토를 막아주므로 다음 실행이 이 구간을 다시 훑어도 중복 검토는 발생하지 않는다.

채택

(없음)

보류

(없음)

탈락

  • Agentic Auto-Research is Fuzz Testing2608.09855 — Gate A 통과(자율 연구 에이전트의 피드백 아키텍처를 그레이박스 퍼저에 비유해 재프레이밍, 핵심 기여가 auto-research 루프 설계). Gate B 즉시 탈락: 정량 평가 없는 포지션 페이퍼 — "controlled tests를 제안한다"고만 서술할 뿐 실제 실험·수치 결과가 없음.

지난 호 다시 보기

2026-09-14 기관 11 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-05 기관 1 · arXiv 10 · 채택 0 · 보류 0 · 탈락 0 2026-09-04 기관 6 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-09-03 기관 3 · arXiv 15 · 채택 2 · 보류 1 · 탈락 4 2026-09-02 기관 3 · arXiv 15 · 채택 2 · 보류 3 · 탈락 4 2026-09-01 기관 2 · arXiv 13 · 채택 0 · 보류 1 · 탈락 1 2026-08-31 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-30 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-29 기관 2 · arXiv 14 · 채택 2 · 보류 0 · 탈락 2 2026-08-28 기관 9 · arXiv 14 · 채택 0 · 보류 0 · 탈락 2 2026-08-27 기관 8 · arXiv 11 · 채택 0 · 보류 0 · 탈락 2 2026-08-26 기관 5 · arXiv 10 · 채택 1 · 보류 0 · 탈락 1 2026-08-25 기관 1 · arXiv 12 · 채택 0 · 보류 0 · 탈락 1 2026-08-24 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-23 기관 2 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-22 기관 4 · arXiv 15 · 채택 0 · 보류 0 · 탈락 2 2026-08-21 기관 5 · arXiv 3 · 채택 0 · 보류 0 · 탈락 4 2026-08-20 기관 2 · arXiv 9 · 채택 2 · 보류 1 · 탈락 0 2026-08-19 기관 2 · arXiv 14 · 채택 1 · 보류 0 · 탈락 3 2026-08-18 기관 1 · arXiv 15 · 채택 2 · 보류 1 · 탈락 0 2026-08-17 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-16 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-15 기관 1 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-14 기관 4 · arXiv 14 · 채택 2 · 보류 1 · 탈락 3 2026-08-13 기관 3 · arXiv 15 · 채택 1 · 보류 1 · 탈락 0 2026-08-11 기관 1 · arXiv 13 · 채택 0 · 보류 0 · 탈락 6 2026-08-10 기관 0 · arXiv 0 · 채택 10 · 보류 0 · 탈락 0 2026-08-09 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-08 기관 8 · arXiv 14 · 채택 2 · 보류 1 · 탈락 4 2026-08-07 기관 0 · arXiv 0 · 채택 0 · 보류 0 · 탈락 0 2026-08-06 채택 0 · 보류 0 · 탈락 0 2026-08-04 채택 2 · 보류 3 · 탈락 9