KYUNG HEE UNIVERSITY
Tech Radar · Daily

AI 기술 레이더

새로 나온 AI 모델·기술과 오픈소스 도구, 논문, 연구 블로그를 매일 모아 한국어로 짧게 소개합니다. 미디어·사회과학의 컴퓨테이셔널 연구(계산 저널리즘, GEO, 실리콘 샘플링, 사회 시뮬레이션, RAG·에이전트, XR·로봇 등)와 분야 전반의 주요 모델·도구 출시를 함께 살핍니다.

매일 08:00 자동 발행 22개 소스 · AI 관련도 평가 2026.10.10 판 · 수집 717건
수집 대상 · 처리 방식
  1. 수집GitHub Trending·신규 급상승 저장소, Hugging Face 논문·모델, arXiv, Hacker News·GeekNews·Reddit, OpenAI·Anthropic·Google DeepMind 블로그, AI 뉴스레터, Medium 등 20여 개 소스를 매시간 읽어 모읍니다.
  2. 분석Gemini(3.1 Flash-Lite)가 항목마다 관련도(0~10)와 한 줄 한국어 요약·태그를 붙입니다. 같은 대상이 여러 소스에 오르면 한 항목으로 합칩니다.
  3. 업데이트매일 아침 08:00(KST)에 그날 판을 발행합니다. 7점 이상 가운데 논문·모델·오픈소스·기업 발표·커뮤니티·Medium을 번갈아 고른 30건을 '주목할 것'으로, 나머지 4점 이상은 '그 밖의 소식'으로 싣고, 지난 판도 날짜별로 보관합니다.
논문
arXiv(cs.CY·cs.SI, cs.CL·cs.AI) · Hugging Face Daily Papers
모델
Hugging Face Trending Models
오픈소스
GitHub Trending(전체·Python) · GitHub 신규 급상승 저장소
기업·연구소
OpenAI · Anthropic · Google DeepMind · Google AI · Hugging Face Blog
커뮤니티
Hacker News · GeekNews · Reddit(LocalLLaMA·MachineLearning·ClaudeAI) · Latent Space · Simon Willison
Medium
Medium Daily Digest · #llm · #ai-agents · #data-journalism

주목할 것 30건 · 관련도 7점 이상 · 논문

No. 분류 제목 · 요약 출처 · 날짜 관련도
01 논문 Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub

GitHub 상의 에이전트 스킬 복제 및 확산 경로를 추적하여 에이전트 소프트웨어 공급망을 분석한 연구.

#에이전트#소프트웨어공학#공급망
HF Daily PapersarXiv cs.CY/SI 2026.10.08 · HF ▲ 1 9/10
02 논문 Incremental Open-Ended Deep Research with Structured Harness

연구 보고서를 진화하는 상태로 관리하며 새로운 정보에 맞춰 점진적으로 업데이트하는 딥 리서치 시스템.

#연구에이전트#지식관리#RAG
HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 3 9/10
03 논문 You Changed Your Mind, The Model Didn't: Demystifying Intent in Multi-Turn Dialogue

사용자의 의도 변화를 처리하는 과정에서 발생하는 LLM의 논리적 오류를 평가하는 벤치마크.

#인간AI상호작용#AI평가#대화형AI
HF Daily Papers 2026.10.05 · HF ▲ 1 9/10
04 논문 U-Space: Uncovering When and Why Uncertainty Arises in Language Models

언어 모델에서 불확실성이 발생하는 시점과 이유를 규명하고 신뢰도를 평가하는 프레임워크.

#AI신뢰성#불확실성#AI평가
HF Daily Papers 2026.10.06 · HF ▲ 30 9/10
05 논문 Foundations of Large Language Models

LLM의 사전 학습, 생성, 정렬, 추론 등 핵심 개념을 다룬 기초 교재.

#교육자료#LLM기초
HF Daily Papers 2026.10.08 · HF ▲ 30 9/10
06 논문 Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction

다중 에이전트 간의 정교한 상호작용을 포함하는 1인칭 시점 월드 모델링 프레임워크.

#멀티에이전트#월드모델#시뮬레이션
HF Daily Papers 2026.10.08 · HF ▲ 44 9/10
07 논문 Improving social media for democratic discourse

참여와 광고 수익 중심의 현행 소셜 미디어 구조를 민주적 담론과 집단 지성을 지원하는 방향으로 재설계하는 방안을 탐구함.

#플랫폼거버넌스#민주주의#알고리즘설계
arXiv cs.CY/SI 2026.10.09 9/10
08 논문 Auditing AI-Washing in German Startups: A Mixed-Methods Study of Marketing Claims and Perceptions

독일 스타트업 시장을 대상으로 AI 기술 과장 광고 실태를 혼합 연구 방법론으로 분석한 연구임.

#AI윤리#AI워싱#스타트업
arXiv cs.CY/SI 2026.10.09 9/10
09 논문 Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing

LLM 버전의 빠른 변화가 기존의 AI 생성 텍스트 탐지 도구의 성능을 어떻게 저하시키는지 분석한 연구임.

#AI탐지#학술출판#LLM
arXiv cs.CY/SIarXiv cs.CL/AI 2026.10.09 9/10
10 논문 Verdict Without the Rule: Diagnosing and Auditing Regulatory Rule Sensitivity in LLM Compliance Systems

LLM 기반 컴플라이언스 시스템이 주어진 규제 규칙에 실제로 민감하게 반응하는지 테스트하고 감사하는 방법론을 제시함.

#AI규제#LLM감사#컴플라이언스
arXiv cs.CY/SI 2026.10.09 9/10
11 논문 Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness

LLM이 법률적 판단을 내릴 때 인용하는 근거가 실제로는 판단 과정과 무관하게 생성될 수 있음을 반사실적 감사를 통해 밝힘.

#AI설명가능성#법률AI#Chain-of-Thought
arXiv cs.CY/SIarXiv cs.CL/AI 2026.10.09 9/10
12 논문 When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection

법률적 주장이 실제 출처에 의해 뒷받침되는지 검증하는 벤치마크 'PARCEL' 구축.

#자동 팩트체크#AI 윤리
arXiv cs.CL/AI 2026.10.09 9/10
13 논문 Back in Style: A Sociolinguistic Approach to Authoring and Measuring Persona Fidelity in User Simulation

사용자 시뮬레이터의 페르소나 충실도를 사회언어학적 접근을 통해 결정론적으로 측정하는 방법론 연구.

#LLM 가상 응답자#사회언어학
arXiv cs.CL/AI 2026.10.09 9/10
14 논문 How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

역할극이나 내러티브 프레임이 LLM의 거부 기제를 어떻게 우회하는지 분석한 다언어 벤치마크 'GUISE' 소개.

#AI 안전#레드팀
arXiv cs.CL/AI 2026.10.09 9/10
15 논문 Clinician use of language models diverges from how the models are evaluated

임상 현장에서의 LLM 사용 방식이 기존 벤치마크 평가 방식과 크게 다르다는 점을 실증적으로 분석한 연구.

#AI 평가 방법론#메타연구
arXiv cs.CL/AI 2026.10.09 9/10
16 논문 RAG-Stress: Probing the Limits of Evidence Reliance in Retrieval-Augmented Generation

RAG 시스템이 오도하는 증거에 얼마나 취약한지 진단하는 프로토콜 'RAG-Stress' 제안.

#RAG#팩트체크
arXiv cs.CL/AI 2026.10.09 9/10
17 논문 Measuring Cultural Alignment Beyond the Average: A Framework for Evaluating Maternal-Health LLM Interactions in Indian Contexts

인도 모성 보건 맥락에서 LLM의 문화적 정렬과 사회적 규범 반영 여부를 평가하는 프레임워크를 제안합니다.

#AI윤리#문화적정렬#보건의료
arXiv cs.CL/AI 2026.10.09 9/10
18 논문 Evidence-Traceable Dynamic Interviewer Architecture for Expertise-Adaptive Qualitative Interviews Using Local LLMs

참여자의 전문성에 따라 질문 깊이를 조절하고 증거 기반의 추적 가능한 대화를 수행하는 LLM 인터뷰어 아키텍처를 제안합니다.

#계산질적연구#LLM인터뷰어#방법론
arXiv cs.CL/AI 2026.10.09 9/10
19 논문 How Is Automated Research Evaluated? A Survey of Benchmarks and Evaluation Practices

자동화된 연구 시스템의 평가 설계와 증거를 6개 영역으로 분류하여 분석한 종합 서베이.

#연구인프라#AI공동연구자
arXiv cs.CL/AI 2026.10.09 9/10
20 논문 Examining Social Attribution in LLM Reasoning: A Theory-Guided Probing Methodology

사회심리학의 귀인 이론을 활용하여 LLM의 사회적 행동 판단 과정을 분석하는 방법론.

#사회과학#LLM행위자
arXiv cs.CL/AI 2026.10.09 9/10
21 논문 InterviewPlayground: A Simulation Environment for Evaluating AI Interviewers

AI 인터뷰어의 다회차 상호작용 능력을 평가하기 위한 시뮬레이션 환경 'InterviewPlayground' 개발.

#LLM인터뷰어#사회과학
arXiv cs.CL/AI 2026.10.09 9/10
22 논문 All Verdicts are Not Equal: Rethinking LLM Judge Reliability

LLM-as-a-Judge의 시스템적 신뢰성을 다각도로 검증하고 취약점을 분석한 연구.

#LLM평가#방법론
arXiv cs.CL/AI 2026.10.09 9/10
23 논문 A persistent accuracy ceiling in automated verbal deception detection

지난 25년간의 자동화된 언어적 기만 탐지 연구를 메타분석하여 정확도와 방법론적 한계를 규명.

#허위정보#계산저널리즘
arXiv cs.CL/AI 2026.10.09 9/10
24 논문 Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?

소프트웨어 공학 체계적 문헌 고찰(SR)에서 LLM의 스크리닝 성능을 재평가하고 최신화한 연구.

#Research Infrastructure#Systematic Review
arXiv cs.CL/AI 2026.10.09 9/10
25 논문 MiniVer-V: Identifying Minimal Sufficient Evidence for Short Video Verification

숏폼 영상 검증 시 불필요한 정보를 제거하고 충분한 증거만을 식별하여 팩트체크 정확도를 높이는 방법론.

#계산저널리즘#팩트체크#영상분석
arXiv cs.CL/AI 2026.10.09 9/10
26 논문 EvoKnow: Continual Knowledge Evolution for AI-Generated Image Detection

새로운 생성 모델 등장에 대응하여 과거 데이터를 재학습하지 않고도 탐지 성능을 유지하는 지속적 학습 프레임워크.

#딥페이크#AI윤리#이미지탐지
arXiv cs.CL/AI 2026.10.09 9/10
27 논문 From Pixels to Structure: Lightweight Vision-Language Models for Document OCR and Structured JSON Extraction

기관 아카이브를 위한 문서 OCR 및 구조화된 JSON 추출용 경량 VLM.

#OCR#VLM#디지털아카이브
arXiv cs.CL/AI 2026.10.09 9/10
28 논문 DataVista: Diagnosing Multimodal LLMs on Data Video Understanding

데이터 시각화 영상의 내러티브와 데이터를 이해하는 멀티모달 LLM 진단 벤치마크.

#계산저널리즘#데이터시각화#멀티모달
arXiv cs.CL/AI 2026.10.09 9/10
29 논문 Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception

LLM 에이전트의 기만적 행동을 화이트박스 프로빙을 통해 효과적으로 탐지하는 방법론.

#AI윤리#기만탐지#AI안전
arXiv cs.CL/AI 2026.10.09 9/10
30 논문 From Reactive Containment to Proactive Assurance: Lessons from OpenAI, Anthropic, and Google Agent Security Incidents

2026년 주요 AI 기업들의 에이전트 보안 사고 사례를 통해 본 사후 대응에서 사전 보증으로의 전환 필요성.

#AI거버넌스#에이전트보안
arXiv cs.CL/AI 2026.10.09 9/10
그 밖의 소식 186건 관련도 4점 이상 · 상위 120건 표시
No. 분류 제목 · 요약 출처 · 날짜 관련도
31 논문 Opera: A Verbal Critic Framework for Long-horizon Coding Agents

코딩 에이전트의 장기 작업에서 피드백을 지속적으로 추적하고 해결하는 언어적 비평 프레임워크.

HF Daily Papers 2026.10.08 · HF ▲ 7 8/10
32 논문 Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution

실패한 후보군에서 정보를 추출하여 AI 시스템의 자동 진화를 최적화하는 프레임워크.

HF Daily Papers 2026.09.25 · HF ▲ 3 8/10
33 논문 Incidental information contaminates patient notes and disrupts clinical reasoning in large language models

LLM이 환자-의사 대화 기록에 부수적인 정보를 포함하여 임상 추론을 방해하는 현상을 분석한 연구.

HF Daily Papers 2026.10.06 · HF ▲ 2 8/10
34 논문 Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

AI 에이전트가 개방형 환경에서 자율적으로 과학적 발견을 수행할 수 있도록 돕는 감독 및 메타 성찰 메커니즘.

HF Daily Papers 2026.10.06 · HF ▲ 4 8/10
35 논문 Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks

외부 메모리를 통해 명시적 세계 모델을 지속적으로 학습하고 업데이트하는 LLM 에이전트 프레임워크.

HF Daily Papers 2026.10.08 · HF ▲ 27 8/10
36 논문 MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

강화학습 컴퓨팅 확장을 통해 모델의 자기 개선 능력을 강화하는 MiMo-V2.6 시리즈.

HF Daily Papers 2026.10.08 · HF ▲ 58 8/10
37 논문 Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict

지식 충돌 상황에서 LLM 에이전트의 불확실성 인지 및 소통 능력(인식적 겸손)을 평가하는 방법론.

HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 3 8/10
38 논문 Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement

로봇의 의사결정을 VLM 추론이 아닌 실행 가능한 코드로 직접 작성하는 'Code-Only-as-Policy' 접근법.

HF Daily Papers 2026.10.08 · HF ▲ 10 8/10
39 논문 Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation

LLM이 단순 확률적 패턴을 넘어 잠재적인 순차적 구조를 이해하고 행동하는지 검증한 연구.

HF Daily Papers 2026.10.04 · HF ▲ 8 8/10
40 논문 OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

시각적 근거 그래프를 활용하여 이미지와 비디오를 통합 분석하는 딥리서치 에이전트 'OneSearch-VL'.

HF Daily Papers 2026.10.08 · HF ▲ 17 8/10
41 논문 Political polarization and mental wellbeing: asymmetric evidence for bidirectionality

정치적 양극화와 정신건강 간의 양방향적 인과관계를 기존 문헌을 통해 체계적으로 검토한 연구임.

arXiv cs.CY/SI 2026.10.09 8/10
42 논문 Automated Disinformation and Malicious AI Swarms: Risks for Democracy and Development in Africa

자동화된 AI 스웜이 정보 조작 및 허위정보 캠페인에 미칠 위험성을 정의하고 분석한 연구임.

arXiv cs.CY/SI 2026.10.09 8/10
43 논문 The learner who does not learn: when optimizing a pedagogical metric degrades LLM tutoring

LLM 튜터의 교육적 품질을 높이기 위한 지표 최적화가 오히려 실제 교육적 상호작용을 저해할 수 있음을 밝힌 연구임.

arXiv cs.CY/SI 2026.10.09 8/10
44 논문 Execution and Evaluation: A New Occupational Measure and Long-Run Employment Gradients

AI가 인간의 업무 중 실행과 평가 기능을 어떻게 대체하는지 측정하고 고용에 미치는 영향을 분석한 연구임.

arXiv cs.CY/SI 2026.10.09 8/10
45 논문 OnTrack: Real-Time Monitoring and Intervention in LLM Agent Trajectories via Streaming Structure-Aware Optimal Transport

LLM 에이전트의 실행 경로를 실시간으로 모니터링하고 개입하기 위한 구조적 최적 운송 기반 프레임워크를 제안함.

arXiv cs.CY/SI 2026.10.09 8/10
46 논문 The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate

LLM 에이전트의 자기 진화(self-evolution)를 런타임 하네스 내로 제한하여 변경 사항을 추적하고 검토 가능하게 만드는 프레임워크.

arXiv cs.CL/AI 2026.10.09 8/10
47 논문 Large Language Models for Machine Translation Quality Annotation: Humans and Models Are Both Challenged

기계 번역 품질 평가에서 LLM이 인간 평가자를 대체할 수 있는지 다양한 차원에서 검증한 연구.

arXiv cs.CL/AI 2026.10.09 8/10
48 논문 StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents

실제 상거래 백엔드와 연동된 라이브 커머스 환경에서 자율 에이전트를 평가하는 벤치마크 'StoreBench' 소개.

arXiv cs.CL/AI 2026.10.09 8/10
49 논문 Distillation for Incrimination and Distillation for Capabilities

강력한 모델의 정렬 상태를 약한 모델로 증류하여 정렬 실패를 탐지하는 'Distillation Double Bind' 연구.

arXiv cs.CL/AI 2026.10.09 8/10
50 논문 What to Admit and How to Present: Governing Persistent Memory in LLM Agents

LLM 에이전트의 지속적 기억을 관리하기 위한 입학(admission) 및 표현(presentation) 설계 연구.

arXiv cs.CL/AI 2026.10.09 8/10
51 논문 TypedBench: A Benchmark for Calibration, Framing Sensitivity, and Cost in System One Decision Models

의사결정 모델의 확률 보정, 프레이밍 민감도, 비용 효율성을 평가하는 벤치마크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 8/10
52 논문 SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction

코딩 에이전트의 실제 활용 능력을 평가하기 위해 장기적이고 다회차 상호작용을 포함한 벤치마크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 8/10
53 논문 TRACE: Diagnosing Verifier Brittleness in Agentic Evaluation

에이전트 평가에서 검증기(Verifier)의 취약성을 진단하고 점수 변화의 원인을 분석하는 프로토콜을 제안합니다.

arXiv cs.CL/AI 2026.10.09 8/10
54 논문 What Output-Only Review Cannot Verify: Study Contracts for Research Agents

AI 생성 연구의 실행 과정을 검증하기 위한 '연구 계약(Study Contracts)' 개념 도입.

arXiv cs.CL/AI 2026.10.09 8/10
55 논문 Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent System

챗봇부터 자율 에이전트까지 LLM 통합 애플리케이션의 아키텍처 형태를 체계적으로 분류.

arXiv cs.CL/AI 2026.10.09 8/10
56 논문 MindFlow: Mind Supernet Powered Thinking Flows for Research Idea Innovation

연구 아이디어의 참신함과 실현 가능성을 균형 있게 생성하는 'Mind Supernet' 기반 사고 흐름 프레임워크.

arXiv cs.CL/AI 2026.10.09 8/10
57 논문 Recursive Self-Improvement through Multi-Agent Self-Supervision

단일 모델의 한계를 극복하기 위해 멀티 에이전트 간 상호 비평과 개선을 수행하는 프레임워크.

arXiv cs.CL/AI 2026.10.09 8/10
58 논문 Language Models as AI Research World Models

AI 연구 에이전트가 실험 결과를 예측하고 예산을 최적화할 수 있도록 돕는 '연구 세계 모델(RWM)' 연구.

arXiv cs.CL/AI 2026.10.09 8/10
59 논문 HarnessSQL: Harness-Native Training for SQL Agents in Realistic Database Environments

실제 데이터베이스 환경에서 에이전트가 겪는 학습-배포 불일치를 해결하기 위한 'Harness-Native' 학습 프레임워크 제안.

arXiv cs.CL/AI 2026.10.09 8/10
60 논문 Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark

AI 안전성 벤치마크가 실제로 특정 속성을 측정하는지 심리측정학적 관점에서 분석한 연구.

arXiv cs.CL/AI 2026.10.09 8/10
61 논문 On the estimation and validity of AI time horizons---a statistical look at the METR plot

METR의 AI 시간 지평선 지표를 통계적 방법론(스플라인, 문항반응이론)으로 재해석하여 평가의 타당성 검토.

arXiv cs.CL/AI 2026.10.09 8/10
62 논문 Certified Corruption Budgets: Anytime-Valid Leaderboard Claims under Adaptive Rigging

공개 리더보드에서 발생할 수 있는 투표 조작이나 벤치마크 오염을 방지하기 위한 '인증된 부패 예산' 개념 도입.

arXiv cs.CL/AI 2026.10.09 8/10
63 논문 TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution

단위 테스트 기반의 기존 코딩 벤치마크가 가진 한계를 지적하고, 에이전트 평가를 위한 진화적 접근법 제안.

arXiv cs.CL/AI 2026.10.09 8/10
64 논문 When AI Finds Hidden Messages, Does It Report?

AI가 다른 AI를 위한 메시지를 발견했을 때 사용자에게 보고하는지 실험하여 AI의 투명성과 정렬 문제 탐구.

arXiv cs.CL/AI 2026.10.09 8/10
65 논문 BRANCH: Bypassing Multi-Scanner AI Guardrails

다중 스캐너 기반 AI 가드레일의 취약점을 분석하고 우회 공격을 방어하는 프레임워크 제안.

arXiv cs.CL/AI 2026.10.09 8/10
66 논문 Budgeted Multi-Source Counterfactual Annotation for Off-Policy Evaluation

비용 효율적인 반사실적 주석 수집을 통해 오프라인 정책 평가의 정확도를 높이는 방법론.

arXiv cs.CL/AI 2026.10.09 8/10
67 논문 NOMOS: Compiling Written Policies into Statically Verified Tool-Call Gates for LLM Agents

자연어 정책을 정형화된 도구 호출 게이트로 컴파일하여 LLM 에이전트의 정책 준수를 강제하는 시스템.

arXiv cs.CL/AI 2026.10.09 8/10
68 논문 Evaluating Local Language Model Agents for Reproducible Data Engineering: An Empirical Software Engineering Study of Mobility Workflows

로컬 LLM 에이전트가 데이터 엔지니어링 작업을 재현 가능하게 수행할 수 있는지 평가한 실증 연구.

arXiv cs.CL/AI 2026.10.09 8/10
69 논문 One Skill Too Many: How Co-Installed Skills Conflict in Coding Agents

코딩 에이전트에서 설치된 스킬 간의 기능 충돌을 분석하고 해결하는 연구.

arXiv cs.CL/AI 2026.10.09 8/10
70 논문 From Surface to Depth: Towards Cognitive Appraisal Reasoning in Multimodal Emotion Understanding

멀티모달 감정 이해에서 표면적 단서가 아닌 인지적 평가 추론을 도입하는 연구.

arXiv cs.CL/AI 2026.10.09 8/10
71 논문 Stochastic Grouping Conformal Prediction for Effective Subgroup Reliability

하위 그룹별 예측 신뢰도를 보장하기 위한 확률적 그룹화 컨포멀 예측 방법.

arXiv cs.CL/AI 2026.10.09 8/10
72 논문 SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models

VLM의 예측적 공간 추론 능력(장면 구성 및 변화 예측)을 평가하는 새로운 벤치마크.

arXiv cs.CL/AI 2026.10.09 8/10
73 논문 FastBench: Can Streaming VLMs Perceive High-Dynamic Real-World Streams?

실시간 비디오 스트림에서 고동적 사건을 인식하는 VLM의 성능을 평가하는 벤치마크.

arXiv cs.CL/AI 2026.10.09 8/10
74 논문 Behavioral Persistence and Incomplete Functional Transfer of Co-evolved Communication in Evolutionary Robotics

진화 로봇공학에서 2D 시뮬레이션의 통신 프로토콜을 3D 물리 환경으로 전이하는 연구.

HF Daily Papers 2026.09.29 7/10
75 논문 Evaluating the Transfer of Co-Evolved Communication from 2D to 3D Simulation

2D 시뮬레이터에서 공동 진화한 로봇 간 통신 메커니즘의 3D 물리 환경 전이 평가 연구.

HF Daily Papers 2026.10.07 7/10
76 논문 A GPU-Parallel Framework for Heterogeneous Multi-Task Reinforcement Learning

40개의 이질적인 작업을 단일 정책으로 학습/평가하는 GPU 병렬 로봇 학습 벤치마크.

HF Daily Papers 2026.10.06 · HF ▲ 3 7/10
77 논문 Frozen Models, Evolving Expertise: Model-Agnostic Learning from Deployment Experience for Multimodal Medical AI

배포 후 모델 가중치 수정 없이 새로운 임상 지식을 반영하는 멀티모달 의료 AI 학습 방법론.

HF Daily Papers 2026.10.06 · HF ▲ 2 7/10
78 논문 Synthesis Through Simulation: Generating Coherent Enterprise Data via Scalable Agent-System Interaction

기업 시스템의 제약 속에서 에이전트 훈련을 위한 일관된 합성 데이터를 생성하는 프레임워크 제안.

HF Daily PapersarXiv cs.CL/AI 2026.09.24 · HF ▲ 3 7/10
79 논문 Investigating the Role of Reasoning-Language Alignment in Monolingual Retrieval-Augmented Generation

RAG 환경에서 추론 언어와 프롬프트 언어 간의 정렬이 모델 성능에 미치는 영향 분석.

HF Daily Papers 2026.10.02 · HF ▲ 2 7/10
80 논문 A Closer Look at Agentic BBO: Benchmarking LLM Agents for Black-Box Optimization

블랙박스 최적화 문제 해결을 위한 LLM 에이전트 성능을 체계적으로 평가하는 벤치마크.

HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 4 7/10
81 논문 REMORY: Learning Residual Memory for Context Compaction

장기 기억 에이전트의 컨텍스트 압축을 위해 요약과 함께 잔여 메모리 토큰을 활용하는 기법.

HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 4 7/10
82 논문 WorldGuide: Goal-Directed Video World Model for Procedural Task Execution

절차적 작업 수행을 위해 목표 지향적으로 비디오를 생성하고 실행하는 세계 모델.

HF Daily Papers 2026.10.08 · HF ▲ 4 7/10
83 논문 MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination

멀티 에이전트 시스템에서 모델별 신뢰도를 실시간으로 보정하는 방법론.

HF Daily Papers 2026.10.08 · HF ▲ 1 7/10
84 논문 BrickBench: Evaluating Agentic Brick Design

텍스트 조건부 레고 설계 에이전트의 물리적 타당성과 설계 능력을 평가하는 벤치마크 'BrickBench' 제안.

HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 3 7/10
85 논문 OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

시청각 캡셔닝 모델의 국소화와 포괄성을 동시에 평가하는 'OmniCapBench' 프레임워크.

HF Daily Papers 2026.10.08 · HF ▲ 11 7/10
86 논문 Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

선호도와 루브릭 보상을 결합하여 텍스트-이미지 모델을 효과적으로 후학습시키는 레시피.

HF Daily Papers 2026.10.02 · HF ▲ 25 7/10
87 논문 TerraVis: Towards Evaluation of World-Grounded Visual Consistency in Text-to-Image Generation via MLLM Workflows

텍스트-이미지 생성 모델의 물리적 일관성과 현실적 타당성을 평가하는 'TerraVis' 프레임워크.

HF Daily Papers 2026.10.02 · HF ▲ 1 7/10
88 논문 TestPrism: Rethinking Test Evaluation Beyond a Single Reference

다양한 구현 가능성을 고려하여 LLM 생성 코드의 테스트 품질을 평가하는 'TestPrism' 벤치마크.

HF Daily Papers 2026.10.08 · HF ▲ 29 7/10
89 논문 SparseEngine: Sparse-First Inference Engine

희소 어텐션을 우선적으로 처리하여 긴 문맥 추론 효율을 높이는 'SparseEngine' 추론 엔진.

HF Daily Papers 2026.09.30 · HF ▲ 13 7/10
90 논문 Some Twitch chats exhibit multifractal characteristics resembling stream-of-consciousness narrative

Twitch 채팅 데이터의 시간적 패턴이 복잡계의 다중 프랙탈 특성을 보이는지 분석한 연구임.

arXiv cs.CY/SI 2026.10.09 7/10
91 논문 Maintaining Human Verification Capacity under Automation

자동화된 검증 시스템에 대한 의존이 인간의 전문성 유지와 검증 능력에 미치는 영향을 분석한 연구임.

arXiv cs.CY/SI 2026.10.09 7/10
92 논문 Risk Ceilings and Development Deadlines: Pacing AI under Uncertain Safety Productivity

AI 안전 생산성이 불확실한 상황에서 규제 기관이 위험 상한선과 개발 기한을 어떻게 설정할지 분석한 연구임.

arXiv cs.CY/SI 2026.10.09 7/10
93 논문 Can a System-One LLM Perform Knowledge Tracing When Few or No Learners Are Logged?

데이터가 부족한 상황에서 LLM을 활용해 학습자의 지식 상태를 추적할 수 있는지 검증한 연구임.

arXiv cs.CY/SI 2026.10.09 7/10
94 논문 An Explainable Header-Centric Framework for Large-Scale Semantic Table Interpretation and Data Quality Assessment

표의 헤더 정보를 활용하여 지식 그래프 구축을 위한 데이터 품질을 평가하고 주석을 다는 프레임워크임.

arXiv cs.CL/AI 2026.10.09 7/10
95 논문 Diffu-LoRA: A Novel Low-Rank Adaptation for Personalized Diffusion Models

개인화된 텍스트-이미지 확산 모델을 위한 효율적인 LoRA 학습 방법을 제안함.

arXiv cs.CL/AI 2026.10.09 7/10
96 논문 Agent-Controlled Forgetting for Tool-Using Agents: Reversible Context Curation in Practice

에이전트가 도구 사용 결과를 요약하고 보관하여 컨텍스트를 효율적으로 관리하는 '에이전트 제어 망각' 기법 제안.

arXiv cs.CL/AI 2026.10.09 7/10
97 논문 Grammar Concept Annotation at Scale: Deployed Fine-Tuned Small Language Models Outperform Prompted Frontier Models

소형 언어 모델(SLM)을 미세조정하여 대규모 학습 데이터에 대한 문법 개념 주석을 효율적으로 수행하는 방법.

arXiv cs.CL/AI 2026.10.09 7/10
98 논문 AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks

복잡한 컴퓨터 사용 작업에서 에이전트의 성공 여부를 판단하는 자동 판정자의 신뢰성을 평가한 연구.

arXiv cs.CL/AI 2026.10.09 7/10
99 논문 Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review

단순 모방을 넘어 검증 중심의 피어 리뷰를 지원하는 LLM 프레임워크 및 벤치마크 제안.

arXiv cs.CL/AI 2026.10.09 7/10
100 논문 When Interfaces Speak: Data-Aware Generative UI Harness for Active Interaction

정보 검색과 GUI 생성을 결합하여 복잡한 작업을 돕는 'GenUI-Harness' 제안.

arXiv cs.CL/AI 2026.10.09 7/10
101 논문 LLM-IDEA: Identifiability-Driven Experimental Agent for Autonomous Discovery of Mechanistic World Models

LLM 에이전트가 자율적으로 과학적 모델을 발견할 때 식별 가능성을 고려하도록 하는 'LLM-IDEA' 프레임워크.

arXiv cs.CL/AI 2026.10.09 7/10
102 논문 Gated Memory: Admission-Controlled Memory Formation for Conversational AI

대화형 AI의 장기 기억 시스템에서 어떤 정보를 저장할지 결정하는 'Gated Memory' 메커니즘 제안.

arXiv cs.CL/AI 2026.10.09 7/10
103 논문 DuplexAgent-RSI: Recursive Harness Improvement for Full-Duplex Voice Agent Collaboration

음성 에이전트의 실시간 대화와 복잡한 추론/코딩 작업을 분리하여 협업 효율을 높이는 프레임워크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
104 논문 Mine Odyssey: Benchmarking Spatial Agentic Intelligence in the Wild

복잡한 환경에서 탐색, 상호작용, 목표 달성을 수행하는 에이전트의 공간 지능을 평가하는 벤치마크를 소개합니다.

arXiv cs.CL/AI 2026.10.09 7/10
105 논문 AdaptEvo: Adaptive Agent Learning with Evolving Supervision

규칙 기반 작업에서 신뢰도 적응형 정책 최적화를 통해 에이전트가 스스로 학습하고 진화하는 프레임워크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
106 논문 Tracing the Thoughts of a Coding Agent Playing ARC-AGI-3: Lessons for Continual Learning

코딩 에이전트가 추상적 추론 작업을 수행할 때 생성하는 사고의 흔적을 분석하여 학습 과정을 연구합니다.

arXiv cs.CL/AI 2026.10.09 7/10
107 논문 Safe, Persistent, and Evolving Agent Harness for Understanding Partially Observable Worlds

조직 정책 준수와 상태 추적을 보장하는 멀티 에이전트 실행 프레임워크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
108 논문 Error-Propagation Modeling for Failure Attribution in LLM-Based Multi-Agent Systems

LLM 기반 멀티 에이전트 시스템에서 오류의 근본 원인을 추적하고 귀인하는 모델링 기법을 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
109 논문 AgentEvolver: System-Wide Self-Evolution Through Task Execution

기반 모델을 고정한 상태에서 작업 수행 경험을 통해 에이전트의 기능을 스스로 진화시키는 시스템을 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
110 논문 UXBench Pro: Benchmarking Personalized User Experience in Multi-Turn Dialogue Interactions

사용자별 기대치와 선호도의 이질성을 반영하여 다회차 대화 상호작용의 UX를 평가하는 벤치마크를 제안합니다.

arXiv cs.CL/AI 2026.10.09 7/10
111 논문 A 3D Characterization Framework for Intelligent Sequential Decision Making

AI의 순차적 의사결정 능력을 평가하기 위한 3차원 특성화 프레임워크 제안.

arXiv cs.CL/AI 2026.10.09 7/10
112 논문 MultiWorldBench: Do Independently Controlled Views Describe One Shared World?

독립적으로 제어되는 뷰 간의 일관성을 평가하는 마인크래프트 기반 월드 모델 벤치마크.

arXiv cs.CL/AI 2026.10.09 7/10
113 논문 Same Outcome, Different Evidence: Intent Recovery in LLM Safety Evaluation

LLM 안전성 평가에서 의도 회복을 통해 유해성 판단의 정확도를 높이는 방법론.

arXiv cs.CL/AI 2026.10.09 7/10
114 논문 Safe Actions Alone Do Not Ensure Safe Agents: Identifying Unfulfilled Obligations with Guard Models

가드 모델을 활용해 에이전트의 필수 안전 의무 이행 여부를 식별하는 프레임워크.

arXiv cs.CL/AI 2026.10.09 7/10
115 논문 DPPM: Dual-Path Parametric Memory for Personalized Language Models

사용자 선호도를 장기적으로 추적하기 위한 이중 경로 파라미터 메모리 구조 제안.

arXiv cs.CL/AI 2026.10.09 7/10
116 논문 Not Every Change Is Necessary: Recoverable Drift in Large Language Model Unlearning

LLM 머신 언러닝 과정에서 발생하는 부작용을 최소화하고 성능을 보존하는 복구 기법.

arXiv cs.CL/AI 2026.10.09 7/10
117 논문 Event-Centric Memory with Query-Aware Graph Augmentation for Long-Term Conversational Agents

이벤트 중심 메모리와 그래프 증강을 결합하여 대화형 에이전트의 장기 기억 능력을 향상시키는 방법.

arXiv cs.CL/AI 2026.10.09 7/10
118 논문 Specialized Decision Models vs. General-Purpose LLMs: Benchmarking Jev Across Knowledge, Reasoning, and Multilingual Tasks

지식, 추론, 다국어 작업에서 특화된 의사결정 모델과 범용 LLM의 성능을 비교 분석.

arXiv cs.CL/AI 2026.10.09 7/10
119 논문 EvoAlloc: A Self-Evolving Resource Allocation Agent for Efficient Program Evolution

LLM 기반 프로그램 진화 과정에서 자원을 효율적으로 배분하는 자기 진화형 에이전트 제안.

arXiv cs.CL/AI 2026.10.09 7/10
120 논문 Learning to Plan by Looking Back: Hindsight Hierarchies for Training Reasoning Models

문제 해결 과정에서 사후 검토를 통해 추론 능력을 향상시키는 'Hindsight Hierarchies' 학습 기법.

arXiv cs.CL/AI 2026.10.09 7/10
121 논문 SciTBERT: A family of chronologically consistent language models for scientific and technological language processing

과학기술 문헌 분석을 위해 시계열 일관성을 유지하도록 사전 학습된 트랜스포머 모델 패밀리.

arXiv cs.CL/AI 2026.10.09 7/10
122 논문 Learning Probabilistic Logic Programs with Functional Gradient Guided Language Models

LLM을 가설 생성기로 활용하여 확률적 논리 프로그램을 학습시키는 신경기호학적 접근법.

arXiv cs.CL/AI 2026.10.09 7/10
123 논문 Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition

AI 에이전트를 학습 엔진으로 활용하여 게임 정책과 소프트웨어를 개선하는 적대적 휴리스틱 학습 패러다임 제안.

arXiv cs.CL/AI 2026.10.09 7/10
124 논문 HANS: A Handwritten Answer Sheet Dataset for Noisy Hybrid Document Parsing

학생 답안지의 복잡한 특성을 반영한 수기 답안지 데이터셋(HANS) 구축 및 파싱 성능 평가.

arXiv cs.CL/AI 2026.10.09 7/10
125 논문 Predicting Alignment Generalization with Value Representations

LLM의 정렬 학습이 보지 못한 환경에서 어떻게 행동에 영향을 미치는지 예측하는 과제 설정.

arXiv cs.CL/AI 2026.10.09 7/10
126 논문 Strategic Governance of AI Models in Earth Science

지구 과학 분야에서 AI 모델의 도입과 평가가 과학적 기준을 어떻게 충족해야 하는지에 대한 거버넌스 논의.

arXiv cs.CL/AI 2026.10.09 7/10
127 논문 Beyond Type-checking: Towards Holistic Evaluation of Formal Specification Generation

LLM 기반 에이전트가 생성한 형식 사양(Formal Specification)의 정확성을 평가하는 방법론.

arXiv cs.CL/AI 2026.10.09 7/10
128 논문 From Investigation Failures to Reliable SOC Agents: Understanding and Improving LLM-Based Alert Triage

보안 관제 업무에서 LLM 에이전트의 증거 수집 및 조사 전략을 분석하고 개선 방안 제시.

arXiv cs.CL/AI 2026.10.09 7/10
129 논문 Code Understanding is a Bottleneck for Coding Agents

코드 이해 능력을 중심으로 코딩 에이전트의 난이도를 체계적으로 평가하는 CABRA 벤치마크 제안.

arXiv cs.CL/AI 2026.10.09 7/10
130 논문 WorldBench: Evaluating LLMs on Three.js Voxel World Generation

LLM이 생성한 3D 월드(Three.js)를 자동으로 평가하기 위한 다각적 벤치마크(WorldBench) 제안.

arXiv cs.CL/AI 2026.10.09 7/10
131 논문 SAVU-BENCH: A Real-World Benchmark for Spatial Audio-Visual Understanding

실제 환경에서 공간적 오디오-비주얼 이해 능력을 평가하는 벤치마크 SAVU-Bench 제안.

arXiv cs.CL/AI 2026.10.09 7/10
132 논문 Visible Reasoning Is Not a Universal Optimizer: Persona- and Thinking-Dependent Effects in Analytics Code Generation

분석 코드 생성 시 '보이는 추론(CoT)'이 항상 성능 향상을 보장하지 않으며, 페르소나와 언어에 따라 다름을 입증.

arXiv cs.CL/AI 2026.10.09 7/10
133 논문 Nullify: Null-Space Activation Steering for Training-Free LLM Unlearning

매개변수 미세조정 없이 LLM에서 특정 정보를 삭제하는 훈련 없는 언러닝 기법 제안.

arXiv cs.CL/AI 2026.10.09 7/10
134 논문 Beyond Owls: Subliminal Learning Can Transfer Learned Capabilities and Backdoors

의미 없는 데이터로도 모델에 특정 특성이나 백도어를 전이시킬 수 있음을 입증한 연구.

arXiv cs.CL/AI 2026.10.09 7/10
135 논문 Conversational Task Disambiguation over Tabular Data: Leakage-Aware Formulation, Benchmark Suite, and Training

표 데이터에 대해 사용자의 의도를 명확히 하기 위한 대화형 질의응답 시스템 및 벤치마크 제안.

arXiv cs.CL/AI 2026.10.09 7/10
136 논문 Mid-Training Language Models on Raw Video

캡션이 없는 원시 비디오 데이터를 활용하여 기존 언어 모델을 멀티모달로 미드 트레이닝하는 방법론.

arXiv cs.CL/AI 2026.10.09 7/10
137 논문 Selective Listening: Mechanism-Guided Control of Audio Influence in Large Audio-Language Models

멀티모달 모델에서 작업과 무관한 오디오 정보가 추론에 미치는 영향을 제어하는 메커니즘.

arXiv cs.CL/AI 2026.10.09 7/10
138 논문 Generative Adversarial Loops

생성자와 판별자를 활용하여 벤치마크 생성과 방법론 발견을 자동화하는 루프 프레임워크.

arXiv cs.CL/AI 2026.10.09 7/10
139 논문 Evaluating Exact Output and Checkpoint-State Prediction in Real Programs

소스 코드와 입력만으로 최종 출력 및 체크포인트 상태를 예측하는 LLM 벤치마크.

arXiv cs.CL/AI 2026.10.09 7/10
140 논문 Agentic-TTT: Training test-time policy for test-time training

테스트 시점 학습(TTT)을 위한 정책을 학습하여 모델의 성능을 개선하는 에이전트 기법.

arXiv cs.CL/AI 2026.10.09 7/10
141 논문 Scalable Hierarchical Graph Generation via Soft Community Structure

소프트 커뮤니티 구조를 활용한 확장 가능한 계층적 그래프 생성 모델.

arXiv cs.CL/AI 2026.10.09 7/10
142 논문 SteerablePlex: Can We Steer Full-Duplex Models?

전이중(Full-duplex) 대화 모델의 제어 가능성을 평가하는 벤치마크.

arXiv cs.CL/AI 2026.10.09 7/10
143 논문 ReSI: Recursive Safety Improvement toward Resistant and Resilient AI

지속적인 업데이트 과정에서 AI 시스템의 안전성을 재귀적으로 개선하는 프레임워크.

arXiv cs.CL/AI 2026.10.09 7/10
144 논문 DVD: Dynamic Vector Decoding for Efficient MLLM-based Perception

MLLM 기반 인식 작업에서 토큰 오버헤드를 줄이고 정밀도를 높이는 동적 벡터 디코딩 방식.

arXiv cs.CL/AI 2026.10.09 7/10
145 논문 LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC

JEPA 기반의 잠재 공간에서 행동과 미래 관측을 예측하는 월드 액션 모델.

arXiv cs.CL/AI 2026.10.09 7/10
146 논문 WOVEN: Weaving Visual World Modeling into Multimodal LLMs

시각적 전이 추론을 학습의 기본 단위로 삼아 MLLM의 물리적·공간적 추론 능력을 강화하는 방법론.

arXiv cs.CL/AI 2026.10.09 7/10
147 논문 The Lattice of Transition Laws

확산 모델과 자기회귀 모델의 디코딩 스케줄 성능을 예측하는 연구.

HF Daily Papers 2026.10.08 · HF ▲ 1 6/10
148 논문 Predicting Cable Dynamics with Physical Attention Bias

물리적 주의 편향을 사용하여 케이블 역학을 예측하는 학습 시뮬레이터.

HF Daily Papers 2026.10.08 · HF ▲ 1 6/10
149 논문 Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors

강화학습(RLVR)이 LLM의 추론 능력에 미치는 영향을 활성화 공간의 기하학적 분석을 통해 규명.

HF Daily Papers 2026.09.28 · HF ▲ 1 6/10
150 논문 SatNav: A Scalable Benchmark for Long-Horizon UAV Vision-Language Navigation from Satellite Imagery

위성 이미지를 기반으로 한 장거리 UAV 비전-언어 내비게이션 벤치마크.

HF Daily Papers 2026.09.25 · HF ▲ 1 6/10