기관 리서치
Google DeepMind
- 신규 없음 (RSS
deepmind.google/blog/rss.xml확인. 최신 글은 8/13 "Introducing Gemini 3.7 Flash" — 이미 다룸)
Google Research
- 신규 없음 (RSS
research.google/blog/rss/확인. 최신 글은 8/17 "Seeing beyond BMI" — 이미 다룸, 커버 범위 이전)
OpenAI
- 신규 없음 (RSS
openai.com/news/rss.xml확인. 8/18~8/19 사이 3건이 새로 올라왔으나 전부 Company/Startup/Product 카테고리이고 Research/Publication은 없음)
Anthropic
- 신규 없음 (research 페이지 확인. 최신 글 "How Claude is accelerating protein design and analytical chemistry"(8/18)는 직전 브리핑에서 이미 다룸)
Meta FAIR / Meta AI
- 신규 없음 (블로그 페이지 확인. 최신 글 7/27 그대로)
Microsoft Research
- 신규 없음 (RSS
/feed/확인. 최신 글은 8/12 "MindTopo Reveals VLMs' Spatial Reasoning Abilities")
NVIDIA Research
- ⚠ 확인 실패 —
research.nvidia.com/publications는 논문마다 게재월만 붙어 있고("December 2026" 등 미래 학회 일자로 표기돼 게시일과 무관), 대체 경로blogs.nvidia.com/feed/의 최신 글(8/17 "Securing the Infrastructure of Intelligence")은 인프라·파트너십 발표라 연구 콘텐츠가 아니어서 신규 연구 게시물 유무를 판별할 수 없음.
Apple ML Research
- Examining Human-Like Behaviors in LLMs: A Multi-Dimensional Analysis of Model Behaviors, User Factors, and System Prompts (2026-08-19) — GPT-4o, GPT-4.1-mini, Claude-Sonnet-4.6, Gemini-2.5-Flash 4개 모델의 대화 21,000건을 분석해 "인간적 행동"(자기지칭, 관계형성, 경계유지 등)의 출현 빈도와 적절성을 측정. 사람 평가자는 자기지칭·관계형성 행동은 AI가 하기엔 부적절하다고 느낀 반면 경계유지 행동은 오히려 AI에게 더 적절하다고 평가했고, 시스템 프롬프트로 이런 행동을 통제할 수 있으나 의도치 않은 부작용을 막으려면 세심한 평가가 필요함을 보임. — 링크
- 관련 주제: AI Agents
- MVICAD2: Multi-View Independent Component Analysis with Delays and Dilations (2026-08-18) — 여러 피험자의 뇌영상 데이터에서 소스가 동일하다고 가정하는 기존 MVICA의 한계를 넘어, 청각 처리에서 흔한 시간 지연뿐 아니라 시간 팽창(dilation)까지 모델링하는 식별 가능한(identifiable) 다중뷰 ICA를 제안. 닫힌형 우도 근사를 유도하고 시뮬레이션·실데이터(Cam-CAN)에서 기존 방법을 능가하며, 이 시간 왜곡이 노화와 상관관계가 있음을 관찰. — 링크
- 관련 주제: 없음 (신경과학 방법론 논문 — 5개 arXiv 주제에 해당하지 않으나 기관 신규 게시물로 기록)
arXiv 신규
색인 지연 참고: 넓은 조회(258건, covered: true)의 최신 게재가 2026-08-18T17:59:01Z로, 실행 시각(2026-08-19T22:38Z) 대비 약 1.2일 지연. 커버 범위(8/18 22:46Z ~ 8/19 22:38Z) 동안 arXiv 색인이 실제로 전진한 폭이 좁았다는 뜻 — "신규 258건"은 직전 브리핑 이후 색인에 새로 잡힌 항목 전체이며 그중 5개 주제 기준 8건을 선별. AI Scientist/Hypothesis Generation 주제에 걸린 후보는 SGHA·Logit-Based Energy Scoring·AutoResearch 셋뿐이었고 이들은 모두 3절 Paper Radar에서 이미 판정했으므로(3절 참고) 여기서는 중복 게재하지 않음.
AI Agents
- On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification (2608.18066) — 온라인 태스크 스트림에서 텍스트 메모리를 쌓아 개선되는 self-improving 에이전트 2종을 다회 실행·태스크 순서 셔플로 재평가. 평가 자체의 잡음이 self-improving 루프에서 증폭되고, 개선 정도가 태스크 순서(암묵적 커리큘럼)에 크게 좌우됨을 발견 — 태스크·환경 명세 부족(underspecification)이 원인 중 하나라는 가설을 rubric·환경 피드백 보강으로 부분 검증했으나 격차가 완전히 닫히진 않음.
- When AI Designs AI: Innovation or Imitation? (2608.17471) — 인간이 설계한 방법에서 태스크별 알고리즘 설계공간을 도출해 LLM 에이전트가 설계한 방법을 그 공간에 매핑, 모듈 단위로 알고리즘적 차이를 정량화. 에이전트가 인간 SOTA를 넘는 경우도 있지만(72개 설정 중 10개) 태스크·에이전트에 걸쳐 일관되지 않고, 에이전트 설계의 96.8%가 인간이 이미 만든 설계공간 안에 있으며 거의 절반은 기존 인간 알고리즘과 정확히 일치.
- Write, Execute, Refine (WER) (2608.17587) — 에이전트가 스스로 작성한 스킬이 스킬 없는 베이스라인보다 8~11점 낮다는 문제에서 출발, 실행 경험을 훈련 상태로 조직해 별도의 "Skill Optimizer"를 훈련. 고정된 실행기가 반복 실행하고 프로그램 검증기가 채점한 성공/실패 궤적으로 다음 단계 정제 상태를 구성 — BFCL v4·tau2-bench에서 no-skill 대비 각각 +7.80/+3.85점, 훈련 없는 동일 백본 대비 +9.35/+10.29점.
Long-context
- MoNe: Modular Neural Memory for Efficient Long Context Inference (2608.17616) — 고정된 사전학습 Transformer에 재학습 없이 붙이는 경량 모듈형 신경 메모리. 컨텍스트를 고정 크기 세그먼트로 읽어 test-time fast-weight 메모리를 학습하고, 추론 시엔 컨텍스트 토큰 재참조 없이 쿼리만으로 키·값을 생성해 O(N) 전처리·O(1) 쿼리 비용을 달성 — 128K 토큰에서 ICL 대비 연산·GPU 메모리 약 80% 절감, 파라미터 오버헤드는 6.4%뿐.
- ArborMem: Navigating Interaction States with Memory Forests (2608.17534) — 장기 대화 메모리를 "탐색 가능한 상태 숲(forest)"으로 표현해, 현재 턴이 어느 이전 상호작용 상태를 재개하는지부터 판별한 뒤 해당 브랜치의 로컬 컨텍스트를 복원. 여러 과제·사람·계획이 뒤섞이고 중단·재개되는 상황을 겨냥한 새 진단 벤치마크(BranchMemEval)도 함께 제안 — LongMemEval·LoCoMo·BEAM 100K에서 최강 베이스라인 대비 3.36~10.31%p 개선.
- Do LLMs Play Six Degrees of Separation? (2608.17950) — 어텐션 가중치 대신 은닉상태 매니폴드의 기하 구조를 직접 분석해, 깊은 LLM의 잠재공간이 스몰월드 네트워크로 조직됨을 발견. 얕은 구문 층은 완전히 단절돼 있지만 깊은 추론 층에서 개념 간 거리가 "6단계 분리" 이내로 급격히 압축되는 위상적 상전이를 관찰, 이 구조를 RAG 환각 탐지(사실 기반 생성은 소스와 약 3-hop 유지, 환각은 위상 붕괴)에 적용.
Reasoning
- Thinking in a Low-Resource Language (2608.17744) — 3.6~4.0B 활성 파라미터의 프론티어 MoE 모델 3종을 그리스어로 추론하도록 파인튜닝. 정확도 벤치마크는 랜덤 시드만 바꿔도 7.7점이 흔들려 사실상 잡음이었지만, SFT 이후 그리스어 질문에서 그리스어로 추론하는 비율이 0%→98%로 급변(유창성 향상, 일반 능력 손실 없음). SFT가 못 고치는 결함(형식 이탈, 추론 채널로의 답 누출)은 검증가능보상 RL이 해결.
- Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation (2608.17941) — RLVR의 롤아웃 탐색 예산을 샘플 난이도에 따라 차등 배분하려는 기존 적응형 스케줄러가 겪는 cold-start·정보 지연 문제를, 의미·추론 유사도로 샘플 그래프를 구성해 이웃 샘플끼리 롤아웃 피드백을 공유하는 방식으로 완화. 잠재 난이도 상태에 Potts prior + Beta-Binomial 집계 + 온라인 평균장 변분추론을 적용, 여러 베이스모델·스케줄러·벤치마크에서 성능 개선.
- Understanding Curriculum Learning in LLMs via Cross-Difficulty Optimization Dynamics (2608.17268) — "커리큘럼이 언제 통하는가"라는 질문에, 난이도 간 전이 관계("Relative Transfer")로 최적화 동역학을 설명하는 통합 이론을 제시. 이 측정치를 바탕으로 훈련 중 샘플링 분포를 동적으로 조정하는 TDCS를 유도, 여러 추론 벤치마크·모델 규모·학습 패러다임에서 기존 스케줄링 전략을 일관되게 능가.
Paper Radar 채택2보류1탈락0
조회 400건 · 신규 258건 · 채택 2 · 보류 1 · 탈락 0
색인 상태: 넓은 조회(400건, covered: true)의 최신 게재가 2026-08-18T17:59:01Z(2608.17906)로, 직전 커서(2026-08-17T17:59:57Z)에서 하루치가 새로 열렸습니다. 실행 시각(2026-08-19T22:38Z) 대비 여전히 약 1.2일 지연이므로, 6절 커서 규칙에 따라 last_run을 실행 시각이 아니라 이번에 실제로 관측된 최신 게재 시각(2026-08-18T17:59:01+00:00)으로 전진시킵니다. 레이더 좁은 관문 후보는 3건(radar_match)이었습니다.
채택
- SGHA (Structural Gap Hypothesis Agent) — Evidence-Grounded Research Problem Discovery with Local Language Models
- arXiv: 2608.17501
- 통과 근거: Gate B-2 — 로컬 오픈웨이트 9B 모델만으로 유형화 증거 그래프 → 구조적 갭 탐지 → corpus-level 검증 → 형식화까지 전 단계를 수행하는 파이프라인으로, "RTX PRO 6000 · 로컬 HF/vLLM · 외부 API 없음"이라는 우리 재현 파이프라인 제약과 정확히 일치하는 방법론(동일 로컬 Qwen3.5-9B로 구동한 AI-Scientist-v2 대비 형식화 품질 전체평균 5.99 vs 4.55, 특히 출처접지 구체성 7.43·모호성 위생 7.61에서 압도, Table 6).
- 파일:
2026/2026_SGHA_Evidence-Grounded-Research-Problem-Discovery-Local-LLM_arXiv2608.17501.pdf· 리뷰:..._리뷰.md
- Logit-Based Energy Scoring — Do LLMs Know a Good Hypothesis When They See One?
- arXiv: 2608.17270
- 통과 근거: Gate B-1 — 가설 평가를 LLM-as-judge/의미 유사도가 아니라 모델의 내재적 로짓 확신(에너지 점수)으로 재프레이밍하는 새 평가 축을 열었고, 코퍼스에 없던 방법(ResearchBench 1,323편·12개 분야에서 pooled Hit@1 33.0% vs 프롬프트 판단 16.6%, Table II).
- 파일:
2026/2026_LogitEnergyScoring_Hypothesis-Ranking-vs-LLM-Judge_arXiv2608.17270.pdf· 리뷰:..._리뷰.md
보류
- AutoResearch: Insight In, Hallucination Out — 2608.17906 — Gate A는 통과(아이디어 생성→실행 closed loop)하나 Gate B 애매: 코퍼스에 이미 있는 ARFT(진단 평가)·SAGE/MHFA(실패 귀인 자가수정)와 문제의식이 겹치고, 실증 근거가 단일 벤치마크(RSICD Recall 32.84→34.69)에 그쳐 새 축·표준 벤치마크·통념 반박 어느 것도 명확히 충족했다고 보기 어려움.
탈락
- 없음