기관 리서치
Google DeepMind
- 신규 없음 (RSS
deepmind.google/blog/rss.xml확인. 최신 글은 8/13 "Introducing Gemini 3.7 Flash" — 이미 다룸)
Google Research
- 신규 없음 (RSS
research.google/blog/rss/확인. 최신 글은 8/17 "Seeing beyond BMI" — 이미 다룸)
OpenAI
- 신규 없음 (RSS
openai.com/news/rss.xml확인. Research/Publication 카테고리 최신 글은 8/1 "Ten advances in mathematics"로, 커버 범위 이전)
Anthropic
- 신규 없음 (research 페이지 확인. 최신 글 "How Claude is accelerating protein design and analytical chemistry"(8/18)는 8/19 브리핑에서 이미 다룸)
Meta FAIR / Meta AI
- 신규 없음 (블로그 페이지 확인. 최신 글 7/27 그대로, RSS 없음)
Microsoft Research
- Broadening access to Skala creates a faster path to predictive DFT (2026-08-20) — Microsoft의 딥러닝 기반 교환-상관 범함수 Skala의 1.1 업데이트. 이전 버전보다 2.5배 많은 데이터로 재학습하고 전자친화도·비공유결합 클러스터 등 학습 범주를 확장했으며, CP2K에 통합 완료(Psi4·FHI-aims·ORCA·VASP는 통합 진행 중). GMTKN55 벤치마크에서 가중평균오차 2.8 kcal/mol로 주요 하이브리드 범함수를 능가하고 55개 범주 중 32개에서 1위를 기록했으며, GPU에서는 r2SCAN meta-GGA와 비슷한 속도, CPU에서는 궤도 300개 이상 시스템에서 오버헤드가 사라짐. — 링크
- 관련 주제: 없음 (계산화학 DFT 도구 — 5개 arXiv 주제에 직접 해당하지 않으나 AI-for-Science 인프라로 기록)
NVIDIA Research
- ⚠ 확인 실패 —
research.nvidia.com/publications는 논문마다 학회 게재월만 표기돼("2026-12" 등 미래 날짜) 실제 게시일과 무관하고, 대체 경로blogs.nvidia.com/feed/의 최신 글(8/20 "Bring the Fire: Play Games on GeForce NOW...")은 게임/제품 소식이라 연구 콘텐츠가 아니어서 신규 연구 게시물 유무를 판별할 수 없음.
Apple ML Research
- Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions (LINK) (2026-08-20) — 목표 언어 데이터가 부족할 때, 고자원(영어) 학습 코퍼스 일부의 단어를 이중언어 어휘집만으로 목표 언어 번역어로 무작위 치환하는 어휘 개입 기법(LINK)을 제안. 추가 모델 학습이나 병렬 코퍼스 없이 8개 언어·5개 모델 크기에서 다운스트림 성능을 유의미하게 끌어올렸고, 동등 성능 도달까지 학습 속도를 최대 2배 단축. — 링크
- 관련 주제: 없음 (다국어 사전학습 데이터 효율화 — 5개 arXiv 주제 밖이나 신규 게시물로 기록)
- Scaling Laws for Mixture Pretraining Under Data Constraints (2026-08-20) — 목표 도메인 데이터가 희소할 때 이를 일반 데이터와 어떤 비율로 섞을지 2,000회 이상의 학습 실행으로 규명. 목표 코퍼스를 15~20회 반복 사용해도 성능이 크게 저하되지 않음을 발견하고, 반복 횟수를 반영한 "repetition-aware mixture scaling law"를 제시해 모델 규모·연산 예산·데이터 제약 사이의 배합 결정에 실전 지침을 제공. — 링크
- 관련 주제: 없음 (프리트레이닝 데이터 배합 스케일링 법칙 — 5개 arXiv 주제 밖이나 신규 게시물로 기록)
- Examining Human-Like Behaviors in LLMs (2026-08-19) — GPT-4o, GPT-4.1-mini, Claude-Sonnet-4.6, Gemini-2.5-Flash 4개 모델의 대화 21,000건을 분석해 "인간적 행동"(자기지칭, 관계형성, 경계유지 등)의 출현 빈도와 적절성을 측정. 사람 평가자는 자기지칭·관계형성 행동은 AI에 부적절하다고 느낀 반면 경계유지 행동은 오히려 적절하다고 평가했고, 시스템 프롬프트로 통제 가능하나 부작용 방지를 위한 세심한 평가가 필요함을 보임. — 링크
- 관련 주제: AI Agents
- The P-Completeness of Inverted Index Traversal (2026-08-19) — AI 에이전트가 검색 인프라 위에서 복잡한 불리언 질의를 평가할 때, 기존 document-at-a-time 방식은 질의 복잡도에 대해 최악의 경우 O(2^|Q|) 지수적 폭발이 나고 term-at-a-time 방식은 전체 문서 집합을 스캔해야 하는 한계를 지적. DAG 기반 질의 언어의 평가가 P-완전임을 증명하고, 양/음 이중 표현과 DAG 메모이제이션으로 평가 시간을 O(|Q|·|U_active|)로 제한하는 알고리즘 ComputePN을 제안해 두 한계를 모두 회피. — 링크
- 관련 주제: AI Agents
arXiv 신규
색인 지연 참고: 넓은 조회(250건, covered: true)의 최신 게재가 2026-08-19T17:58:56Z로, 실행 시각(2026-08-20T22:43Z) 대비 약 1.2일 지연. "신규 250건"은 직전 브리핑 이후 색인에 새로 잡힌 항목 전체이며 그중 5개 주제 기준 12건을 선별. Hypothesis Generation 주제에는 뚜렷이 해당하는 신규 후보가 없어 이번 회차는 섹션을 생략함. 레이더 좁은 관문(radar_match) 후보 4건은 모두 3절 Paper Radar에서 판정했으므로(3절 참고) 여기서는 중복 게재하지 않음.
AI Agents
- SPADE: Self-Play in Adaptive Synthetic Executable Environments (2608.19197) — 하나의 LLM이 Gym 스타일 reset()/step() 인터페이스를 가진 실행 가능한 학습 환경을 코드로 직접 작성하는 "Environment Designer"와 그 안에서 행동하는 "Reasoning Agent" 두 역할을 자기대국(self-play)으로 수행. Designer는 Agent의 특권 힌트 유무에 따른 보상 격차(regret)를 신호로 삼아 난이도를 에이전트 역량의 경계로 맞춰가고, 30B 모델 규모에서 8개 held-out 벤치마크 평균 +5.3, BFCL-v4 멀티턴 +5.7, ACEBench-Agent +13.9의 개선을 보임.
- SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents (2608.18852) — 에이전트가 실행 중 어떤 스킬 파일을 읽을지 선택하는 결정을, 기존 outcome-보상 RL로는 학습할 수 없는 구조적 이유("selector credit starvation": 스킬을 지목하는 토큰이 시퀀스 전체 어드밴티지에서 신호를 거의 못 받고, 길어질수록 오귀속됨)를 규명. 실행 토큰과 스킬 지목 토큰의 크레딧 채널을 분리하는 SkillGate를 제안해 16개 후보 슬레이트 하에서 9B 정책의 과제 성공률을 40.8%→53.2%로 끌어올림.
- FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (2608.18423) — LLM 에이전트가 26개 도구로 축구팀을 20년간 운영하며 예산·이적·계약·시설 투자 등 340~400회의 의사결정을 내리는 벤치마크. 15개 프론티어 모델을 고정 시나리오(solo)와 동일 세계에서 맞대결(Arena)시키는, 이 규모에서는 최초의 정면 대결 평가로, claude-fable-5가 solo·Arena 모두 1위를 기록했으나 순위는 모델 규모·가격·벤더와 무관하고 장기 지평이 지나서야 갈렸으며, 어떤 모델도 수백 건의 거절된 입찰에서 시장의 숨은 가격을 학습하지 못함.
Paper Radar 채택0보류0탈락4
조회 400건 · 신규 250건 · 채택 0 · 보류 0 · 탈락 4
색인 상태: 넓은 조회(400건, covered: true)의 최신 게재가 2026-08-19T17:58:56Z(2608.19025)로, 실행 시각(2026-08-20T22:43Z) 대비 약 1.2일 지연되어 있고 직전 커서(2026-08-18T17:59:01+00:00)에서 하루치가 새로 열렸습니다. 6절 커서 규칙에 따라 last_run을 실행 시각이 아니라 이번에 실제로 관측된 최신 게재 시각(2026-08-19T17:58:56+00:00)으로 전진시킵니다. 레이더 좁은 관문 후보는 4건(radar_match)이었습니다.
채택
없음
보류
없음
탈락
- Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models — 2608.19025 — Gate A 탈락: 핵심 기여가 문헌에서의 데이터 추출 워크플로우 신뢰성 확보이지, 자율연구 파이프라인·가설생성·아이디어평가 어느 것도 아니며 LLM을 도구로 쓴 응용 논문.
- Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution — 2608.18575 — Gate A 탈락: 범용 멀티에이전트 시스템의 실패 귀인 진단 방법으로, 연구 자동화·가설 생성이 아닌 일반 MAS 디버깅 도구.
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement — 2608.18543 — Gate A 탈락: 전자상거래 CRM·고객 재참여를 위한 상용 응용 시스템으로, 과학 연구 자동화와 무관.
- Science Done on a Machine by a Machine: AI Agents in Computational Chemistry — 2608.18508 — Gate A는 통과 소지(연구 자동화 트렌드를 다룸) 있으나 Gate B 탈락: 정량 평가 없는 퍼스펙티브/포지션 논문이며, 서베이 예외(코어 3토픽 전반의 첫 본격 서베이)에 해당하지 않음 — 화학 도메인에 한정된 관찰 에세이.