기관 리서치
Google DeepMind
- 신규 없음 (RSS 정상 확인, 최신 글은 2026-09-30 "Gemini 4 Argon"로 커버 범위 이전)
Google Research
- Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle — 에이전트형(agentic) AI 시스템에서 발생하는 프라이버시·보안 문제를 "컨텍스트" 관점에서 다룬 글. 에이전트 아키텍처 특유의 신종 위협(맥락 유출, 권한 경계 모호화 등)을 분석하고 이를 이해·완화하기 위한 프레임워크를 제시한다. — 링크
- 관련 주제: AI Agents
OpenAI
- 신규 없음 (RSS 정상 확인, 10/5자 신규 글 2건은 모두 Safety/Product 카테고리로 Research/Publication 조건에 해당하지 않아 제외: "Our approach to EU text provenance rules", "Building advertising for the way people use AI")
Anthropic
- 신규 없음 (페이지 정상 로드, 최신 글은 2026-10-01 "Claude-shaped science"로 커버 범위 이전)
Meta FAIR / Meta AI
- 신규 없음 (블로그 인덱스 정상 확인, 최신 글은 2026-07-27로 커버 범위와 크게 떨어짐)
Microsoft Research
- 신규 없음 (RSS 정상 확인, 최신 글은 2026-09-30 "Forecasting space weather risks on power grids"로 커버 범위 이전)
NVIDIA Research
- Relight: Simple, User-Level Checkpointing and Fast Forward Replay for Distributed Task-Based Systems — 분산 task 기반 프로그램을 위한 자동 체크포인팅 프레임워크. 사용자 코드의 수동 데이터 마이그레이션 없이 기존 task/collection 구조를 그대로 활용해 프로그램 상태를 캡처·복원하며, 수백 노드 규모 시스템에서 전체 작업 복구를 위한 효율적인 fast-forward replay를 제공한다. 벤치마크에서 수정하지 않은 코드와 비슷한 성능을 유지함을 보였다(저자: Elliott Slaughter, Rupanshu Soi, Michael Bauer, Alex Aiken). — 링크
- 관련 주제: 없음 (분산 시스템 인프라, 5개 주제 무관)
Apple ML Research
- Negotiating Ontological Boundaries in User-Authored Personal Sensing Systems — Wizard-of-Oz 프로브 기법으로 사용자가 직접 개인화된 센싱 ML 시스템을 학습시키게 하면서, 그 과정에서 시스템 설계가 "무엇이 가능하거나 상상 가능한 것으로 여겨지는지"를 어떻게 형성하는지 탐구한 HCI 연구. 사용자-저작형 센싱 애플리케이션에서 존재론적 경계가 협상되는 방식을 분석한다. — 링크
- 관련 주제: 없음 (HCI 연구, 5개 주제 무관)
arXiv 신규
AI Agents
- Sentry: Learning to Recover from LLM Agent Failures at Test Time (2610.02994) — LLM 에이전트가 테스트 시점에 겪는 실패(잘못된 도구 호출, 반복 행동 등)로부터 학습해 복구하는 방법을 다룬다. 실패 지식은 "조건부"라서 에이전트 컨텍스트에 계속 유지하면 그 실패가 없는 상황에서 오히려 역효과를 내며, 진화하는 플레이북에서 제거하는 쪽이 성능을 높인다는 발견이 핵심이다.
- Securing Computer-Use Agents Against Branch Steering Attacks (2610.03089) — 그래픽 인터페이스를 다루는 Computer Use Agent(CUA)가 간접 프롬프트 주입에 노출되는 문제를 다룬다. 격리된 Planner-LLM과 격리된 Quarantined-LLM을 쓰는 Dual-LLM 패턴이 형식적 보안 보장을 주지만, CUA는 동적으로 분기해야 하므로 계획을 데이터-독립적으로 유지할 수 없어 이 보장이 GUI 환경에서는 무너진다는 점을 지적한다.
- VERSE: Verified Self-Evolving Optimizer for Agent Harnesses (2610.02616) — 에이전트 하니스(프롬프트·도구·워크플로)를 개선하는 옵티마이저 자신의 진단·수정·검증 절차도 함께 자가진화시키는 접근. 실행 기반 검증 없이는 옵티마이저 자가진화가 성능 개선에 실패하지만, 검증이 주어지면 가장 좋은 결과를 낸다는 통제 실험 결과를 보인다.
- DeskForge: Dense Supervision from Desktop Environments for Computer-Use Agents (2610.02320) — 여러 앱·중첩 창·유사한 컨트롤이 공존하는 복잡한 데스크톱 화면에서 Computer-Use 에이전트의 행동 타겟 그라운딩을 위한 대규모 학습 데이터를 생성하는 통제 가능한 데스크톱 환경을 제안한다. 앱 상태·레이아웃·해상도를 체계적으로 변화시키고 스크린샷·접근성 트리·창 geometry를 함께 제공한다.
AI Scientist / Automated Research
- The AI Theorist Reveals Excitonic Structure in α-RuCl₃ (2610.02417) — AI 에이전트 시스템(가설 생성→1차 원리 계산→증거 기반 정제)이 아직 출판되지 않은 양자물질 α-RuCl₃의 반사·광전류 스펙트럼을 자율적으로 해석해, 상반된 광학 선택 규칙을 갖는 들뜸자(exciton) 상태를 식별했다. 저자들에 따르면 AI 시스템이 미출판 실험 관측을 설명하는 물리 모델을 자율 개발한 최초 사례다. (오늘 Paper Radar에도 채택 — 3절 참조. 레이더 통과는 이 기사와 별개의 독립 판정이다.)
- ULTRADISCOVERY: Abductive Exploration in an Interconnected, Epistemically Open Universe (2610.03092) — 과학적 발견에서 "설명을 서술할 표현 자체를 새로 구성해야 하는 상황(인식적으로 열린 세계)"과 "여러 맥락에 흩어진 증거를 종합해야 하는 상황(구조적으로 상호연결된 세계)"을 분리해 평가하는 벤치마크가 없다는 문제를 제기한다. 5개 도메인으로 구성된 상호작용형 환경에서 에이전트가 초기에 성공적이던 이론을 수정하고 미지의 교차도메인 개입 결과를 예측하게 한다.
- Reliable Self-Evolution with Imperfect Proxy Rewards (2610.02975) — 과학적 발견을 위한 LLM 기반 자가진화 탐색에서, 고비용 정밀 평가 대신 저비용이지만 불완전한 proxy reward를 쓰면 거짓양성(실현 불가능한 후보에 높은 점수)이 최종 출력과 다음 세대 피드백을 오염시킬 수 있음을 지적한다. 통계적으로 보정된 reward 구간(Conformal Interval-Driven Search)을 제안해 이 문제를 완화한다.
Hypothesis Generation
- MOF-VERIFY: A Failure-Aware Agentic Harness for MOF Hypothesis Verification (2610.03056) — 재료과학용 AI Co-Scientist가 금속-유기 골격체(MOF) 가설을 검증할 때의 신뢰성을 진단하는 벤치마크. 구조체가 여러 식별자로 불릴 수 있고, 합성 결과가 실험 조건에 크게 좌우되며, 증거가 이질적 소스에 분산되어 있고, 일부 가설은 문헌만으로 부족해 계산이 필요한 상황을 구조적 그라운딩·합성 등 4개 과제군으로 평가한다.
- Hypothesis-guided discovery of cognitive algorithms via program refinement (2610.02523) — 행동 데이터로부터 인지적 알고리즘 모델을 발견하는 문제를 "프로그램 정제(program refinement)"로 재구성한 하이브리드 시스템을 제안한다. 전통적 인지 모델링(해석 가능하지만 확장성 부족)과 LLM 기반 생성(확장 가능하지만 인간 전문성 반영 부족·단순 과제 위주)의 장점을 결합하려는 시도다.
Long-context
- Gated Slot Attention-2: Two-Sided Associative Memory Correction in Linear Attention (2610.02816) — 선형 어텐션의 고정 크기 재귀 메모리 관리 문제에서, delta-rule 계열(정밀한 key-value 메모리 보정)과 slot 기반 구조(2단계 key/value 메모리 모델링)가 서로 상호보완적임을 관찰해 두 방향을 결합한 아키텍처를 제안한다.
- The Surprising Effectiveness of Shared Memory in Looped Transformers (2610.02383) — 같은 레이어를 토큰마다 여러 번 반복 적용하는 Looped Transformer는 반복마다 자체 KV 캐시를 써서 메모리가 계산량에 비례해 커지는 문제가 있다. 첫 반복만 캐시를 쓰고 이후 반복은 그 캐시를 읽기만 하며 자신의 캐시는 짧은 윈도우만 유지하도록 사전학습하면, 품질 저하 없이 오히려 품질이 개선된다는 의외의 결과를 150M~1B 파라미터 규모에서 보고한다.
- Exact Memory-Time Optimization for Prefix-Cached Language Model Serving (2610.02766) — 프리픽스 캐싱 서빙에서 각 캐시 블록을 독립적으로 최적화하면 절감 효과를 과대 집계할 수 있다는 문제(한 블록은 앞선 prefix가 함께 있어야만 쓸모 있음)를 지적하고, 이를 정확히 모델링하는 유한-trace 최적화(PCR)를 제안해 최대-가중치 closure를 단일 min-cut 문제로 환원한다.
Reasoning
- Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability (2610.03509) — 더 적은 토큰으로 추론하도록 학습시키는 효율적 추론 훈련이 CoT의 충실성(모델의 실제 결정을 반영하는 정도)을 해친다는 우려가 있었으나, 효율화 방법마다 CoT 길이 압박을 가하는 방식이 달라 실제로 언제·어떻게 그런 일이 일어나는지는 불명확했다는 문제의식에서 체계적으로 검증한다.
- On the Chain-of-Thought Monitorability of Looped Language Models (2610.02741) — 공유 트랜스포머 레이어를 반복 적용해 실질적 계산 깊이를 늘리는 Looped LM(LoopLM)이 CoT 모니터링 가능성(바람직하지 않은 모델 행동을 CoT로 탐지하는 능력)에 미치는 영향을 최초로 체계적으로 평가한다.
- Reasoning Models Are Accurate but Unsound on Identification (2610.03519) — 관측 데이터로부터 인과 효과를 복원할 수 있는지 묻는 질의에서, 추론 모델이 식별 가능한 질의를 거부하거나 식별 불가능한 질의에 (검증 불가능한) 답을 내는 두 실패 모드를 분석한다. 증명 가능하게 식별 불가능한 질의와, 동치 형태의 정답도 인정하는 채점을 제공하는 CERTID 파이프라인을 구축해 이를 정량화한다.
🤗 HuggingFace Papers 트렌딩
- ⚠ 확인 실패 —
huggingface.co도메인이 egress 프록시에 의해 차단되어 API·페이지 모두 접근 불가 (5일 연속). WebSearch 우회는 금지 원칙에 따라 시도하지 않음.
Paper Radar 채택1보류2탈락1
조회 600건 · 신규 485건 · 채택 1 · 보류 2 · 탈락 1
색인 상태: newest_fetched 2026-10-02T17:59:14Z — 직전 커서(2026-10-01T17:59:58Z, 10-03~10-05 사이 이틀간 전혀 전진하지 못했던 수위)에서 하루 전진했다. 10-03/10-04/10-05 로그에서 경고했던 색인 정체는 이번 실행에서 풀렸다 — 단순 장애가 아니라 일시적 정체였던 것으로 보인다. 다만 실행 시각(2026-10-05 22:39 UTC)보다는 여전히 약 76.7시간(3.2일) 뒤처져 있어 지연 자체는 해소되지 않았다. 6절 규칙에 따라 wall-clock이 아닌 관측된 가장 최신 published(2026-10-02T17:59:14Z) 를 다음 --last-run 커서로 쓴다 — 10-02 18시 이후 투고분은 아직 후보에 오르지 못했으므로 색인이 따라잡히는 대로 다음 실행에서 정상적으로 올라올 것이다.
신규 485건 중 radar_match 4건만 Gate A/B로 넘겼다.
채택
- AI Theorist — The AI Theorist Reveals Excitonic Structure in α-RuCl₃
- arXiv: 2610.02417
- 통과 근거: Gate B-1/B-3 — 코퍼스의 기존 AI-Scientist 논문들이 대부분 ML 실험·벤치마크·프레임워크를 다루는 데 비해, 이 논문은 아직 출판되지 않은 실제 양자물질(α-RuCl₃) 실험 데이터에 대해 AI 에이전트 시스템이 자율적으로 새 물리 해석(들뜸자 상태의 광학 선택 규칙, §3)을 구축하고 독립 인간 이론가의 교차검증까지 받은, 코퍼스에 없던 "실제 자연과학 발견 사례" 축을 열었다. 편광 회전에 따른 α′/α 강도 변화라는 반증 가능한 예측(§4)까지 제시해 단순 데모가 아닌 실증적 기여로 판단.
- 파일:
2026/2026_AITheorist_Autonomous-Physical-Model-Discovery_arXiv2610.02417.pdf· 리뷰:2026_AITheorist_Autonomous-Physical-Model-Discovery_arXiv2610.02417_리뷰.md
보류
- Learning What to Investigate Next: Meta-Reasoning for Long-Horizon Research Agents (MIRA) — 2610.02525 — Gate A(장기 호라이즌 연구 에이전트의 메타추론)는 통과하나, 코퍼스의
PrimeScientist(남은 예산에 조건화된 전략적 연구 노력 배분)와 "무엇을 다음에 조사할지 결정"하는 동일 문제 축을 다뤄, RL 기반 전이 가능한 가치 예측이라는 방법론 차이가 새 축인지 PrimeScientist의 정교화인지 애매. - Continual Graph Memory for Mathematical Research Agents (Ansatz) — 2610.02945 — Gate A(장기 호라이즌 수학 연구 에이전트의 메모리·지식 재사용)는 통과하고 미해결 Erdős 문제 일부에 진전을 보였으나, 코퍼스의
Agora(git 기반 공유 메모리)·YouRA(영속 상태 아키텍처)와 "연구 궤적을 조직화하는 메모리 시스템"이라는 축이 겹쳐 순수 수학 정리증명이라는 좁은 도메인 특화가 독립적 기여로 볼 만큼 강한지 애매.
탈락
- Learning Transferable Policies from Action-free Time Series Through Dynamical Embeddings — 2610.03065 — 핵심 기여가 행동(action) 정보 없는 시계열 녹화로부터 제어 정책을 학습하는 계층적 모델기반 강화학습 프레임워크(신경과학·물리계 적용)로, "메커니즘적 가설 생성(mechanistic hypothesis generation)"이 초록에 한 차례 언급될 뿐 핵심 기여가 자율 연구 에이전트/가설 탐색/아이디어 평가가 아니라 Gate A 미충족(
radar_match는 "hypothesis" 키워드 우연 일치).