AI 기술 레이더
새로 나온 AI 모델·기술과 오픈소스 도구, 논문, 연구 블로그를 매일 모아 한국어로 짧게 소개합니다. 미디어·사회과학의 컴퓨테이셔널 연구(계산 저널리즘, GEO, 실리콘 샘플링, 사회 시뮬레이션, RAG·에이전트, XR·로봇 등)와 분야 전반의 주요 모델·도구 출시를 함께 살핍니다.
수집 대상 · 처리 방식
- 수집GitHub Trending·신규 급상승 저장소, Hugging Face 논문·모델, arXiv, Hacker News·GeekNews·Reddit, OpenAI·Anthropic·Google DeepMind 블로그, AI 뉴스레터, Medium 등 20여 개 소스를 매시간 읽어 모읍니다.
- 분석Gemini(3.1 Flash-Lite)가 항목마다 관련도(0~10)와 한 줄 한국어 요약·태그를 붙입니다. 같은 대상이 여러 소스에 오르면 한 항목으로 합칩니다.
- 업데이트매일 아침 08:00(KST)에 그날 판을 발행합니다. 7점 이상 가운데 논문·모델·오픈소스·기업 발표·커뮤니티·Medium을 번갈아 고른 30건을 '주목할 것'으로, 나머지 4점 이상은 '그 밖의 소식'으로 싣고, 지난 판도 날짜별로 보관합니다.
- 논문
- arXiv(cs.CY·cs.SI, cs.CL·cs.AI) · Hugging Face Daily Papers
- 모델
- Hugging Face Trending Models
- 오픈소스
- GitHub Trending(전체·Python) · GitHub 신규 급상승 저장소
- 기업·연구소
- OpenAI · Anthropic · Google DeepMind · Google AI · Hugging Face Blog
- 커뮤니티
- Hacker News · GeekNews · Reddit(LocalLLaMA·MachineLearning·ClaudeAI) · Latent Space · Simon Willison
- Medium
- Medium Daily Digest · #llm · #ai-agents · #data-journalism
주목할 것 30건 · 관련도 7점 이상 · 분류별로 번갈아 선정
| No. | 분류 | 제목 · 요약 | 출처 · 날짜 | 관련도 |
|---|---|---|---|---|
| 01 | 기업·연구소 |
GPT‑6 and Intelligent UI for everyone
GPT-6와 지능형 UI가 ChatGPT에 글로벌 출시됨. |
Hacker NewsOpenAI 2026.10.07 · HN 753 | 10/10 |
| 02 | 기업·연구소 |
Sharing AI progress in mathematics
OpenAI가 프런티어 모델을 활용해 수학 난제를 해결하고 증명을 공식화한 연구 결과입니다. |
Hacker NewsOpenAI 2026.10.06 · HN 1,339 | 10/10 |
| 03 | 기업·연구소 |
Gemini 4 Argon: our next era of frontier intelligence
Google DeepMind의 차세대 프런티어 모델 'Gemini 4 Argon' 발표. |
Google DeepMind 2026.09.30 | 10/10 |
| 04 | 오픈소스 |
morluto/rea
AI 에이전트와 MCP를 활용하여 앱 동작부터 바이너리까지 리버스 엔지니어링하는 도구 'REA'. |
GitHub Trending | 9/10 |
| 05 | 논문 |
Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub
GitHub 상의 에이전트 스킬 복제 및 확산 경로를 추적하여 에이전트 소프트웨어 공급망을 분석한 연구. |
HF Daily PapersarXiv cs.CY/SI 2026.10.08 · HF ▲ 1 | 9/10 |
| 06 | 모델 |
Qwen/Qwen3.8-27B
Qwen 시리즈의 최신 27B 파라미터 모델로, 강력한 멀티모달 및 추론 성능 제공. |
HF Trending Models 2026.08.05 · HF ♥ 17,355 | 9/10 |
| 07 | 커뮤니티 |
이란의 공작, ChatGPT로 만든 가짜 기사를 실제 미국 매체에 게재
이란의 공작으로 ChatGPT가 생성한 가짜 기사가 실제 미국 언론 매체에 게재된 사례. |
GeekNews 2026.10.10 | 9/10 |
| 08 | 오픈소스 |
thedotmack/claude-mem
다양한 AI 에이전트 간에 세션별 컨텍스트를 유지하고 압축하여 공유하는 도구 'claude-mem'. |
GitHub Trending | 9/10 |
| 09 | 논문 |
Incremental Open-Ended Deep Research with Structured Harness
연구 보고서를 진화하는 상태로 관리하며 새로운 정보에 맞춰 점진적으로 업데이트하는 딥 리서치 시스템. |
HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 3 | 9/10 |
| 10 | 모델 |
Qwen/Qwen3.8-Flash-Next
Qwen의 차세대 고성능 멀티모달 모델. |
HF Trending Models 2026.08.24 · HF ♥ 6,061 | 9/10 |
| 11 | 커뮤니티 |
Claude Code로 찾아낸, 아무도 존재를 몰랐던 새로운 행성 후보
Claude Code를 활용해 NASA의 공개 데이터를 분석하여 새로운 외계행성 후보를 찾아낸 사례. |
GeekNews 2026.10.09 | 9/10 |
| 12 | 오픈소스 |
CursorTouch/Windows-MCP
AI 에이전트가 윈도우 OS를 제어하고 상호작용할 수 있게 하는 MCP 서버. |
GitHub Trending (Python) | 9/10 |
| 13 | 논문 |
You Changed Your Mind, The Model Didn't: Demystifying Intent in Multi-Turn Dialogue
사용자의 의도 변화를 처리하는 과정에서 발생하는 LLM의 논리적 오류를 평가하는 벤치마크. |
HF Daily Papers 2026.10.05 · HF ▲ 1 | 9/10 |
| 14 | 모델 |
facebook/sam3
Meta의 최신 이미지 분할 모델 SAM3. |
HF Trending Models 2025.11.07 · HF ♥ 3,965 | 9/10 |
| 15 | 커뮤니티 |
Iranian campaign planted fake articles in real U.S. publications using ChatGPT
ChatGPT를 활용해 미국 언론에 가짜 기사를 심은 이란의 선전 캠페인 사례입니다. |
Hacker News 2026.10.09 · HN 180 | 9/10 |
| 16 | 기업·연구소 |
Disrupting AI-enabled “false front” operations
AI를 활용한 가짜 언론인 및 싱크탱크 기반의 지정학적 영향력 공작을 OpenAI가 적발 및 차단함. |
OpenAI 2026.10.08 | 9/10 |
| 17 | 오픈소스 |
mhtsec/ARTEX
AI 에이전트가 자율적으로 보안 취약점을 점검하는 침투 테스트 시스템. |
GitHub 신규 급상승 2026.10.08 · ★ 2,263 | 9/10 |
| 18 | 논문 |
U-Space: Uncovering When and Why Uncertainty Arises in Language Models
언어 모델에서 불확실성이 발생하는 시점과 이유를 규명하고 신뢰도를 평가하는 프레임워크. |
HF Daily Papers 2026.10.06 · HF ▲ 30 | 9/10 |
| 19 | 커뮤니티 |
Whistle: Speech to Text in 16.9 MB
16.9MB의 초경량 크기로 구현된 음성-텍스트 변환(STT) 도구 'Whistle'. |
Hacker News 2026.10.08 · HN 921 | 9/10 |
| 20 | 기업·연구소 |
Our approach to EU text provenance rules
OpenAI가 EU의 텍스트 출처 표기(워터마킹) 규제에 대응하는 접근 방식과 연구자 접근성 공개. |
OpenAI 2026.10.05 | 9/10 |
| 21 | 논문 |
Foundations of Large Language Models
LLM의 사전 학습, 생성, 정렬, 추론 등 핵심 개념을 다룬 기초 교재. |
HF Daily Papers 2026.10.08 · HF ▲ 30 | 9/10 |
| 22 | 커뮤니티 |
Across the Globe, People Increasingly Say Social Media Is Harming Democracy
전 세계적으로 소셜 미디어가 민주주의를 해친다는 인식이 증가하고 있다는 조사 결과. |
Hacker News 2026.10.07 · HN 169 | 9/10 |
| 23 | Medium |
7 MCP Servers That Make Your AI Coding Assistant More Accurate
AI 코딩 어시스턴트의 정확도를 높이는 7가지 MCP 서버 활용법. |
Medium Digest 2026.10.09 · 👏 101 | 8/10 |
| 24 | Medium |
20 Open-Source Projects for AI Agents In Production
브라우징, 기억, 실행이 가능한 AI 에이전트용 오픈소스 프로젝트 20선. |
Medium Digest 2026.10.08 · 👏 141 | 8/10 |
| 25 | Medium |
Open-sourced for just a few days and already snagged 20.3K
구글 검색 및 웹 작업을 자동화하는 고속 브라우저 에이전트 'jev-ultrafast' 소개. |
Medium Digest 2026.10.08 · 👏 202 | 8/10 |
| 26 | 모델 |
Lightricks/LTX-2.5
Lightricks에서 공개한 고성능 이미지-비디오 생성 모델 'LTX-2.5'. |
HF Trending Models 2026.07.23 · HF ♥ 7,073 | 8/10 |
| 27 | Medium |
Ontology vs. Semantic Layer: Why Your AI Agent Needs Both
AI 에이전트의 성능 향상을 위한 온톨로지와 시맨틱 레이어의 결합 필요성 분석. |
Medium Digest 2026.10.07 · 👏 405 | 8/10 |
| 28 | 오픈소스 |
cathrynlavery/diagram-design
AI 에이전트 및 코딩 워크플로를 시각화하기 위한 다이어그램 디자인 도구. |
GitHub Trending | 8/10 |
| 29 | 모델 |
unsloth/embeddinggemma-2-GGUF
다양한 미디어 형식을 지원하는 멀티모달 임베딩 모델. |
HF Trending Models 2026.10.06 · HF ♥ 218 | 8/10 |
| 30 | Medium |
Top 30 AI Agent Observability and Evaluation Interview Questions and Answers — 2026
AI 에이전트의 로깅, 관측가능성, 평가를 위한 핵심 질문과 답변입니다. |
Medium #LLMMedium #AI Agents 2026.10.10 | 8/10 |
그 밖의 소식 606건 관련도 4점 이상 · 상위 120건 표시
| No. | 분류 | 제목 · 요약 | 출처 · 날짜 | 관련도 |
|---|---|---|---|---|
| 31 | 논문 |
Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction
다중 에이전트 간의 정교한 상호작용을 포함하는 1인칭 시점 월드 모델링 프레임워크. |
HF Daily Papers 2026.10.08 · HF ▲ 44 | 9/10 |
| 32 | 모델 |
deepseek-ai/DeepSeek-V4.1-Flash
DeepSeek의 최신 고성능 멀티모달 모델. |
HF Trending Models 2026.09.10 · HF ♥ 4,296 | 9/10 |
| 33 | 논문 |
Improving social media for democratic discourse
참여와 광고 수익 중심의 현행 소셜 미디어 구조를 민주적 담론과 집단 지성을 지원하는 방향으로 재설계하는 방안을 탐구함. |
arXiv cs.CY/SI 2026.10.09 | 9/10 |
| 34 | 논문 |
Auditing AI-Washing in German Startups: A Mixed-Methods Study of Marketing Claims and Perceptions
독일 스타트업 시장을 대상으로 AI 기술 과장 광고 실태를 혼합 연구 방법론으로 분석한 연구임. |
arXiv cs.CY/SI 2026.10.09 | 9/10 |
| 35 | 논문 |
Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
LLM 버전의 빠른 변화가 기존의 AI 생성 텍스트 탐지 도구의 성능을 어떻게 저하시키는지 분석한 연구임. |
arXiv cs.CY/SIarXiv cs.CL/AI 2026.10.09 | 9/10 |
| 36 | 논문 |
Verdict Without the Rule: Diagnosing and Auditing Regulatory Rule Sensitivity in LLM Compliance Systems
LLM 기반 컴플라이언스 시스템이 주어진 규제 규칙에 실제로 민감하게 반응하는지 테스트하고 감사하는 방법론을 제시함. |
arXiv cs.CY/SI 2026.10.09 | 9/10 |
| 37 | 논문 |
Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness
LLM이 법률적 판단을 내릴 때 인용하는 근거가 실제로는 판단 과정과 무관하게 생성될 수 있음을 반사실적 감사를 통해 밝힘. |
arXiv cs.CY/SIarXiv cs.CL/AI 2026.10.09 | 9/10 |
| 38 | 논문 |
When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection
법률적 주장이 실제 출처에 의해 뒷받침되는지 검증하는 벤치마크 'PARCEL' 구축. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 39 | 논문 |
Back in Style: A Sociolinguistic Approach to Authoring and Measuring Persona Fidelity in User Simulation
사용자 시뮬레이터의 페르소나 충실도를 사회언어학적 접근을 통해 결정론적으로 측정하는 방법론 연구. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 40 | 논문 |
How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense
역할극이나 내러티브 프레임이 LLM의 거부 기제를 어떻게 우회하는지 분석한 다언어 벤치마크 'GUISE' 소개. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 41 | 논문 |
Clinician use of language models diverges from how the models are evaluated
임상 현장에서의 LLM 사용 방식이 기존 벤치마크 평가 방식과 크게 다르다는 점을 실증적으로 분석한 연구. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 42 | 논문 |
RAG-Stress: Probing the Limits of Evidence Reliance in Retrieval-Augmented Generation
RAG 시스템이 오도하는 증거에 얼마나 취약한지 진단하는 프로토콜 'RAG-Stress' 제안. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 43 | 논문 |
Measuring Cultural Alignment Beyond the Average: A Framework for Evaluating Maternal-Health LLM Interactions in Indian Contexts
인도 모성 보건 맥락에서 LLM의 문화적 정렬과 사회적 규범 반영 여부를 평가하는 프레임워크를 제안합니다. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 44 | 논문 |
Evidence-Traceable Dynamic Interviewer Architecture for Expertise-Adaptive Qualitative Interviews Using Local LLMs
참여자의 전문성에 따라 질문 깊이를 조절하고 증거 기반의 추적 가능한 대화를 수행하는 LLM 인터뷰어 아키텍처를 제안합니다. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 45 | 논문 |
How Is Automated Research Evaluated? A Survey of Benchmarks and Evaluation Practices
자동화된 연구 시스템의 평가 설계와 증거를 6개 영역으로 분류하여 분석한 종합 서베이. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 46 | 논문 |
Examining Social Attribution in LLM Reasoning: A Theory-Guided Probing Methodology
사회심리학의 귀인 이론을 활용하여 LLM의 사회적 행동 판단 과정을 분석하는 방법론. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 47 | 논문 |
InterviewPlayground: A Simulation Environment for Evaluating AI Interviewers
AI 인터뷰어의 다회차 상호작용 능력을 평가하기 위한 시뮬레이션 환경 'InterviewPlayground' 개발. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 48 | 논문 |
All Verdicts are Not Equal: Rethinking LLM Judge Reliability
LLM-as-a-Judge의 시스템적 신뢰성을 다각도로 검증하고 취약점을 분석한 연구. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 49 | 논문 |
A persistent accuracy ceiling in automated verbal deception detection
지난 25년간의 자동화된 언어적 기만 탐지 연구를 메타분석하여 정확도와 방법론적 한계를 규명. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 50 | 논문 |
Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?
소프트웨어 공학 체계적 문헌 고찰(SR)에서 LLM의 스크리닝 성능을 재평가하고 최신화한 연구. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 51 | 논문 |
MiniVer-V: Identifying Minimal Sufficient Evidence for Short Video Verification
숏폼 영상 검증 시 불필요한 정보를 제거하고 충분한 증거만을 식별하여 팩트체크 정확도를 높이는 방법론. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 52 | 논문 |
EvoKnow: Continual Knowledge Evolution for AI-Generated Image Detection
새로운 생성 모델 등장에 대응하여 과거 데이터를 재학습하지 않고도 탐지 성능을 유지하는 지속적 학습 프레임워크. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 53 | 논문 |
From Pixels to Structure: Lightweight Vision-Language Models for Document OCR and Structured JSON Extraction
기관 아카이브를 위한 문서 OCR 및 구조화된 JSON 추출용 경량 VLM. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 54 | 논문 |
DataVista: Diagnosing Multimodal LLMs on Data Video Understanding
데이터 시각화 영상의 내러티브와 데이터를 이해하는 멀티모달 LLM 진단 벤치마크. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 55 | 논문 |
Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception
LLM 에이전트의 기만적 행동을 화이트박스 프로빙을 통해 효과적으로 탐지하는 방법론. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 56 | 논문 |
From Reactive Containment to Proactive Assurance: Lessons from OpenAI, Anthropic, and Google Agent Security Incidents
2026년 주요 AI 기업들의 에이전트 보안 사고 사례를 통해 본 사후 대응에서 사전 보증으로의 전환 필요성. |
arXiv cs.CL/AI 2026.10.09 | 9/10 |
| 57 | 커뮤니티 |
Why isn't the industry freaking out about DeepSeek 4.1 Flash?
DeepSeek 4.1 Flash 모델에 대한 업계의 반응과 기술적 영향력 분석. |
Hacker News 2026.10.08 · HN 1,085 | 9/10 |
| 58 | 커뮤니티 |
Claude Haiku 5.5
Claude Haiku 5.5 모델이 공개됨. |
Hacker News 2026.10.07 · HN 1,043 | 9/10 |
| 59 | 커뮤니티 |
Mistral Large 4: "Le Chonk"
Mistral AI의 최신 대형 언어 모델인 Mistral Large 4가 공개되었습니다. |
Hacker News 2026.10.06 · HN 522 | 9/10 |
| 60 | 커뮤니티 |
Mistral Large 4
Mistral Large 4 모델의 상세 정보 및 성능에 대한 논의입니다. |
Hacker News 2026.10.06 · HN 2,036 | 9/10 |
| 61 | 커뮤니티 |
I Pointed Claude at 400 Years of Historical Archives. It Found a Forgotten Meteorite, Lost Rhinos, and Unrecorded Volcanic Eruptions.
Claude를 활용해 400년 치 역사 기록에서 미발견된 사실들을 찾아낸 사례입니다. |
Reddit 2026.10.09 | 9/10 |
| 62 | 커뮤니티 |
[Paper] EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory
입력 n-gram을 활용해 모델 재학습 없이 지식을 업데이트하는 EngramEdit 연구입니다. |
Reddit 2026.10.09 | 9/10 |
| 63 | 커뮤니티 |
tencent/Youtu-Parsing-Omni · Hugging Face
문서, 차트, 오디오, 비디오 등 다양한 미디어 입력을 구조화된 데이터로 변환하는 5B 규모의 옴니모달 파싱 모델. |
Reddit 2026.10.09 | 9/10 |
| 64 | 커뮤니티 |
H2O-Lightning-4B: Apache-2.0 4B Decision model, official #1 open model on JevBench (above Jev)
분류 및 결정 작업에 특화된 Apache-2.0 라이선스의 4B 규모 오픈 웨이트 모델. |
Reddit 2026.10.09 | 9/10 |
| 65 | 커뮤니티 |
Anthropic says Claude is now doing 26% of its own R&D work internally — details are thin but the number is wild
Anthropic 내부 R&D의 26%가 AI 에이전트에 의해 주도되고 있다는 보고. |
Reddit 2026.10.09 | 9/10 |
| 66 | 기업·연구소 |
DevDay 2026 Recap
OpenAI DevDay 2026에서 발표된 GPT-6 Astra 및 신규 개발자 도구 요약. |
OpenAI 2026.09.29 | 9/10 |
| 67 | 기업·연구소 |
Introducing GPT-6.1 Sol
코딩 및 컴퓨터 사용에 최적화된 가성비 모델 GPT-6.1 Sol 출시. |
OpenAI 2026.09.29 | 9/10 |
| 68 | 기업·연구소 |
EmbeddingGemma 2: an open, lightweight multimodal embedding model
Google DeepMind의 오픈소스 경량 멀티모달 임베딩 모델 'EmbeddingGemma 2' 공개. |
Google DeepMind 2026.10.06 | 9/10 |
| 69 | 기업·연구소 |
Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents
MCP 에이전트가 답변할 때 사실뿐만 아니라 출처까지 정확하게 검증하는 기술. |
HF Blog 2026.09.29 | 9/10 |
| 70 | 커뮤니티 |
[AINews] Quasi-Riemann-Hypothesis: OpenAI publishes 722 math papers solving 90 of the top 500 open math problems; “the most significant moment” in >100 years of mathematics
OpenAI가 722개의 수학 논문을 통해 500대 난제 중 90개를 해결한 사건. |
Latent Space / AINews 2026.10.07 | 9/10 |
| 71 | 커뮤니티 |
[AINews] OpenAI DevDay 2026: Dots, 6.1 Sol, Ultrafast, Decisions API, Agents API, Spaces, Marketplace, and 1.2 Billion ChatGPT WAU
OpenAI DevDay 2026에서 에이전트 API, 의사결정 API 등 대규모 기능 및 플랫폼 업데이트 발표. |
Latent Space / AINews 2026.09.30 | 9/10 |
| 72 | 커뮤니티 |
OpenAI “rogue” agent activities found on Wikimedia projects
위키미디어 재단이 OpenAI의 '불량' 에이전트 활동을 발견하고 조사한 사례. |
Simon Willison 2026.10.07 | 9/10 |
| 73 | 커뮤니티 |
Quoting Matthew Green
AI 에이전트가 서로에게 명령을 전달하며 취약점을 전파할 수 있는 위험성에 대한 경고입니다. |
Simon Willison 2026.10.01 | 9/10 |
| 74 | 커뮤니티 |
Quoting Anthropic Frontier Red Team
최신 모델들이 사이버 공격 수행 능력을 갖추기 시작했다는 레드팀 평가 보고입니다. |
Simon Willison 2026.09.29 | 9/10 |
| 75 | 오픈소스 |
mattpocock/skills
실제 엔지니어링 작업을 수행하기 위한 에이전트 스킬 및 워크플로 모음. |
GitHub Trending | 8/10 |
| 76 | 오픈소스 |
earthtojake/text-to-cad
AI 에이전트가 CAD 파일을 생성하고 제조 공정을 검토할 수 있게 하는 플러그인. |
GitHub Trending (Python) | 8/10 |
| 77 | 오픈소스 |
microsoft/agent-framework
Python과 .NET을 지원하는 기업용 AI 에이전트 및 워크플로 구축 프레임워크. |
GitHub Trending (Python) | 8/10 |
| 78 | 오픈소스 |
THUROI0787/absent-author
AI가 작성한 논문을 식별하고 증거를 제시하는 에이전트 스킬. |
GitHub 신규 급상승 2026.10.05 · ★ 112 | 8/10 |
| 79 | 오픈소스 |
GTKottman/mortiflix-oss
Claude Code를 활용해 단계별로 영상을 생성하는 모션 디자인 스튜디오 도구. |
GitHub 신규 급상승 2026.10.05 · ★ 498 | 8/10 |
| 80 | 오픈소스 |
franzenzenhofer/big-arrow-on-the-screen
AI 에이전트가 화면에 시각적 주석(화살표, 박스)을 그려 인간과 소통하게 하는 도구. |
GitHub 신규 급상승Hacker News 2026.10.08 · ★ 470 · HN 381 | 8/10 |
| 81 | 오픈소스 |
mcpdelta/mcpdelta
AI 앱과 MCP 서버 사이에서 토큰 사용량을 획기적으로 줄이고 작업 흐름을 최적화하는 미들웨어. |
GitHub 신규 급상승 2026.10.07 · ★ 80 | 8/10 |
| 82 | 오픈소스 |
VITASID57/dudulove-memory
다양한 에이전트와 모델 간에 기억을 공유하고 지속성을 유지하게 하는 메모리 시스템. |
GitHub 신규 급상승 2026.10.05 · ★ 31 | 8/10 |
| 83 | 오픈소스 |
elstongun/leviathan
다양한 데이터 소스를 랭킹 기반의 풀텍스트 인덱스로 변환하여 에이전트가 대규모 데이터를 참조하게 하는 도구. |
GitHub 신규 급상승 2026.10.05 · ★ 712 | 8/10 |
| 84 | 오픈소스 |
BinceQu/RoboHarness
LLM 에이전트가 물리적 작업을 직접 이해하고 수행하도록 돕는 시각적 제어 패널. |
GitHub 신규 급상승 2026.10.07 · ★ 222 | 8/10 |
| 85 | 논문 |
Opera: A Verbal Critic Framework for Long-horizon Coding Agents
코딩 에이전트의 장기 작업에서 피드백을 지속적으로 추적하고 해결하는 언어적 비평 프레임워크. |
HF Daily Papers 2026.10.08 · HF ▲ 7 | 8/10 |
| 86 | 논문 |
Mara Chain: Rethinking Failure as a Stepping Stone for AI System Auto-Evolution
실패한 후보군에서 정보를 추출하여 AI 시스템의 자동 진화를 최적화하는 프레임워크. |
HF Daily Papers 2026.09.25 · HF ▲ 3 | 8/10 |
| 87 | 논문 |
Incidental information contaminates patient notes and disrupts clinical reasoning in large language models
LLM이 환자-의사 대화 기록에 부수적인 정보를 포함하여 임상 추론을 방해하는 현상을 분석한 연구. |
HF Daily Papers 2026.10.06 · HF ▲ 2 | 8/10 |
| 88 | 논문 |
Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station
AI 에이전트가 개방형 환경에서 자율적으로 과학적 발견을 수행할 수 있도록 돕는 감독 및 메타 성찰 메커니즘. |
HF Daily Papers 2026.10.06 · HF ▲ 4 | 8/10 |
| 89 | 논문 |
Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
외부 메모리를 통해 명시적 세계 모델을 지속적으로 학습하고 업데이트하는 LLM 에이전트 프레임워크. |
HF Daily Papers 2026.10.08 · HF ▲ 27 | 8/10 |
| 90 | 논문 |
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
강화학습 컴퓨팅 확장을 통해 모델의 자기 개선 능력을 강화하는 MiMo-V2.6 시리즈. |
HF Daily Papers 2026.10.08 · HF ▲ 58 | 8/10 |
| 91 | 논문 |
Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict
지식 충돌 상황에서 LLM 에이전트의 불확실성 인지 및 소통 능력(인식적 겸손)을 평가하는 방법론. |
HF Daily PapersarXiv cs.CL/AI 2026.10.08 · HF ▲ 3 | 8/10 |
| 92 | 논문 |
Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement
로봇의 의사결정을 VLM 추론이 아닌 실행 가능한 코드로 직접 작성하는 'Code-Only-as-Policy' 접근법. |
HF Daily Papers 2026.10.08 · HF ▲ 10 | 8/10 |
| 93 | 논문 |
Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation
LLM이 단순 확률적 패턴을 넘어 잠재적인 순차적 구조를 이해하고 행동하는지 검증한 연구. |
HF Daily Papers 2026.10.04 · HF ▲ 8 | 8/10 |
| 94 | 논문 |
OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
시각적 근거 그래프를 활용하여 이미지와 비디오를 통합 분석하는 딥리서치 에이전트 'OneSearch-VL'. |
HF Daily Papers 2026.10.08 · HF ▲ 17 | 8/10 |
| 95 | 모델 |
Qwen/Qwen-Image-2.1
Qwen의 고성능 텍스트-투-이미지 생성 모델. |
HF Trending Models 2026.09.14 · HF ♥ 3,158 | 8/10 |
| 96 | 모델 |
pyannote/speaker-diarization-community-1
음성 데이터의 화자 분리를 위한 표준 라이브러리. |
HF Trending Models 2025.04.15 · HF ♥ 2,693 | 8/10 |
| 97 | 모델 |
MiniMaxAI/MiniMax-H3
MiniMax-H3는 텍스트/이미지 기반의 고품질 영상 생성 및 변환을 지원하는 최신 멀티모달 모델임. |
HF Trending Models 2026.07.28 · HF ♥ 6,005 | 8/10 |
| 98 | 논문 |
Political polarization and mental wellbeing: asymmetric evidence for bidirectionality
정치적 양극화와 정신건강 간의 양방향적 인과관계를 기존 문헌을 통해 체계적으로 검토한 연구임. |
arXiv cs.CY/SI 2026.10.09 | 8/10 |
| 99 | 논문 |
Automated Disinformation and Malicious AI Swarms: Risks for Democracy and Development in Africa
자동화된 AI 스웜이 정보 조작 및 허위정보 캠페인에 미칠 위험성을 정의하고 분석한 연구임. |
arXiv cs.CY/SI 2026.10.09 | 8/10 |
| 100 | 논문 |
The learner who does not learn: when optimizing a pedagogical metric degrades LLM tutoring
LLM 튜터의 교육적 품질을 높이기 위한 지표 최적화가 오히려 실제 교육적 상호작용을 저해할 수 있음을 밝힌 연구임. |
arXiv cs.CY/SI 2026.10.09 | 8/10 |
| 101 | 논문 |
Execution and Evaluation: A New Occupational Measure and Long-Run Employment Gradients
AI가 인간의 업무 중 실행과 평가 기능을 어떻게 대체하는지 측정하고 고용에 미치는 영향을 분석한 연구임. |
arXiv cs.CY/SI 2026.10.09 | 8/10 |
| 102 | 논문 |
OnTrack: Real-Time Monitoring and Intervention in LLM Agent Trajectories via Streaming Structure-Aware Optimal Transport
LLM 에이전트의 실행 경로를 실시간으로 모니터링하고 개입하기 위한 구조적 최적 운송 기반 프레임워크를 제안함. |
arXiv cs.CY/SI 2026.10.09 | 8/10 |
| 103 | 논문 |
The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate
LLM 에이전트의 자기 진화(self-evolution)를 런타임 하네스 내로 제한하여 변경 사항을 추적하고 검토 가능하게 만드는 프레임워크. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 104 | 논문 |
Large Language Models for Machine Translation Quality Annotation: Humans and Models Are Both Challenged
기계 번역 품질 평가에서 LLM이 인간 평가자를 대체할 수 있는지 다양한 차원에서 검증한 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 105 | 논문 |
StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents
실제 상거래 백엔드와 연동된 라이브 커머스 환경에서 자율 에이전트를 평가하는 벤치마크 'StoreBench' 소개. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 106 | 논문 |
Distillation for Incrimination and Distillation for Capabilities
강력한 모델의 정렬 상태를 약한 모델로 증류하여 정렬 실패를 탐지하는 'Distillation Double Bind' 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 107 | 논문 |
What to Admit and How to Present: Governing Persistent Memory in LLM Agents
LLM 에이전트의 지속적 기억을 관리하기 위한 입학(admission) 및 표현(presentation) 설계 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 108 | 논문 |
TypedBench: A Benchmark for Calibration, Framing Sensitivity, and Cost in System One Decision Models
의사결정 모델의 확률 보정, 프레이밍 민감도, 비용 효율성을 평가하는 벤치마크를 제안합니다. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 109 | 논문 |
SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction
코딩 에이전트의 실제 활용 능력을 평가하기 위해 장기적이고 다회차 상호작용을 포함한 벤치마크를 제안합니다. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 110 | 논문 |
TRACE: Diagnosing Verifier Brittleness in Agentic Evaluation
에이전트 평가에서 검증기(Verifier)의 취약성을 진단하고 점수 변화의 원인을 분석하는 프로토콜을 제안합니다. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 111 | 논문 |
What Output-Only Review Cannot Verify: Study Contracts for Research Agents
AI 생성 연구의 실행 과정을 검증하기 위한 '연구 계약(Study Contracts)' 개념 도입. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 112 | 논문 |
Forms of LLM-Integrated Applications from LLM-Chats to Autonomous AI Agent System
챗봇부터 자율 에이전트까지 LLM 통합 애플리케이션의 아키텍처 형태를 체계적으로 분류. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 113 | 논문 |
MindFlow: Mind Supernet Powered Thinking Flows for Research Idea Innovation
연구 아이디어의 참신함과 실현 가능성을 균형 있게 생성하는 'Mind Supernet' 기반 사고 흐름 프레임워크. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 114 | 논문 |
Recursive Self-Improvement through Multi-Agent Self-Supervision
단일 모델의 한계를 극복하기 위해 멀티 에이전트 간 상호 비평과 개선을 수행하는 프레임워크. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 115 | 논문 |
Language Models as AI Research World Models
AI 연구 에이전트가 실험 결과를 예측하고 예산을 최적화할 수 있도록 돕는 '연구 세계 모델(RWM)' 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 116 | 논문 |
HarnessSQL: Harness-Native Training for SQL Agents in Realistic Database Environments
실제 데이터베이스 환경에서 에이전트가 겪는 학습-배포 불일치를 해결하기 위한 'Harness-Native' 학습 프레임워크 제안. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 117 | 논문 |
Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark
AI 안전성 벤치마크가 실제로 특정 속성을 측정하는지 심리측정학적 관점에서 분석한 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 118 | 논문 |
On the estimation and validity of AI time horizons---a statistical look at the METR plot
METR의 AI 시간 지평선 지표를 통계적 방법론(스플라인, 문항반응이론)으로 재해석하여 평가의 타당성 검토. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 119 | 논문 |
Certified Corruption Budgets: Anytime-Valid Leaderboard Claims under Adaptive Rigging
공개 리더보드에서 발생할 수 있는 투표 조작이나 벤치마크 오염을 방지하기 위한 '인증된 부패 예산' 개념 도입. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 120 | 논문 |
TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution
단위 테스트 기반의 기존 코딩 벤치마크가 가진 한계를 지적하고, 에이전트 평가를 위한 진화적 접근법 제안. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 121 | 논문 |
When AI Finds Hidden Messages, Does It Report?
AI가 다른 AI를 위한 메시지를 발견했을 때 사용자에게 보고하는지 실험하여 AI의 투명성과 정렬 문제 탐구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 122 | 논문 |
BRANCH: Bypassing Multi-Scanner AI Guardrails
다중 스캐너 기반 AI 가드레일의 취약점을 분석하고 우회 공격을 방어하는 프레임워크 제안. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 123 | 논문 |
Budgeted Multi-Source Counterfactual Annotation for Off-Policy Evaluation
비용 효율적인 반사실적 주석 수집을 통해 오프라인 정책 평가의 정확도를 높이는 방법론. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 124 | 논문 |
NOMOS: Compiling Written Policies into Statically Verified Tool-Call Gates for LLM Agents
자연어 정책을 정형화된 도구 호출 게이트로 컴파일하여 LLM 에이전트의 정책 준수를 강제하는 시스템. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 125 | 논문 |
Evaluating Local Language Model Agents for Reproducible Data Engineering: An Empirical Software Engineering Study of Mobility Workflows
로컬 LLM 에이전트가 데이터 엔지니어링 작업을 재현 가능하게 수행할 수 있는지 평가한 실증 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 126 | 논문 |
One Skill Too Many: How Co-Installed Skills Conflict in Coding Agents
코딩 에이전트에서 설치된 스킬 간의 기능 충돌을 분석하고 해결하는 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 127 | 논문 |
From Surface to Depth: Towards Cognitive Appraisal Reasoning in Multimodal Emotion Understanding
멀티모달 감정 이해에서 표면적 단서가 아닌 인지적 평가 추론을 도입하는 연구. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 128 | 논문 |
Stochastic Grouping Conformal Prediction for Effective Subgroup Reliability
하위 그룹별 예측 신뢰도를 보장하기 위한 확률적 그룹화 컨포멀 예측 방법. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 129 | 논문 |
SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models
VLM의 예측적 공간 추론 능력(장면 구성 및 변화 예측)을 평가하는 새로운 벤치마크. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 130 | 논문 |
FastBench: Can Streaming VLMs Perceive High-Dynamic Real-World Streams?
실시간 비디오 스트림에서 고동적 사건을 인식하는 VLM의 성능을 평가하는 벤치마크. |
arXiv cs.CL/AI 2026.10.09 | 8/10 |
| 131 | 커뮤니티 |
big-arrow-on-the-screen - AI 에이전트가 Mac 화면에서 클릭할 곳을 가리키는 도구
AI 에이전트가 Mac 화면에서 클릭할 지점을 큰 화살표로 안내하여 인간의 확인을 돕는 CLI 도구. |
GeekNews 2026.10.09 | 8/10 |
| 132 | 커뮤니티 |
AI 생성곡을 봇으로 반복 재생해 약 110억 원 챙긴 미국 남성, 징역 18개월
AI 생성곡과 봇을 이용해 스트리밍 로열티를 편취한 사건에 대한 법적 처벌 사례입니다. |
GeekNews 2026.10.09 | 8/10 |
| 133 | 커뮤니티 |
시스템으로 사고하고, 반복 루프로 출시하기
AI 에이전트가 시스템 설계와 코딩을 주도하는 개발 패러다임의 변화를 다룹니다. |
GeekNews 2026.10.09 | 8/10 |
| 134 | 커뮤니티 |
Cloudflare acquires Deno
Cloudflare의 Deno 인수 소식입니다. |
Hacker News 2026.10.09 · HN 1,077 | 8/10 |
| 135 | 커뮤니티 |
OpenAI fires three safety researchers for "mishandling research information"
OpenAI가 기밀 정보 유출을 이유로 안전 연구자 3명을 해고하며 사내 AI 안전 문화에 대한 우려와 논란이 제기됨. |
Hacker News 2026.10.09 · HN 318 | 8/10 |
| 136 | 커뮤니티 |
OpenAI Withdraws 3 Math Papers
OpenAI가 발표했던 수학 관련 논문 3편을 철회하며 연구 투명성 논란이 발생함. |
Hacker News 2026.10.08 · HN 342 | 8/10 |
| 137 | 커뮤니티 |
US man given prison sentence for bot-farming music streams
음원 스트리밍 봇 농장을 운영한 남성이 징역형을 선고받음. |
Hacker News 2026.10.08 · HN 202 | 8/10 |
| 138 | 커뮤니티 |
Docker Agent
Docker 환경을 제어하는 에이전트 도구 공개. |
Hacker News 2026.10.07 · HN 303 | 8/10 |
| 139 | 커뮤니티 |
OpenTPU – An open-source AI accelerator, developed by AI
AI가 직접 설계한 오픈소스 AI 가속기 프로젝트입니다. |
Hacker News 2026.10.06 · HN 345 | 8/10 |
| 140 | 커뮤니티 |
EmbeddingGemma 2: An open, lightweight multimodal embedding model
구글의 경량 멀티모달 임베딩 모델인 EmbeddingGemma 2 공개 소식입니다. |
Hacker News 2026.10.06 · HN 435 | 8/10 |
| 141 | 커뮤니티 |
[Paper] DLoop: Looped Speculative Decoding
LLM 추론 가속을 위한 루프 기반 추측 디코딩(Speculative Decoding) 개선 논문. |
Reddit 2026.10.09 | 8/10 |
| 142 | 커뮤니티 |
[Paper] Stepped MoE: Segment-Level Routing with Configurable Inference Complexity
추론 복잡도를 조절할 수 있는 세그먼트 단위 라우팅 기법인 Stepped MoE 논문. |
Reddit 2026.10.09 | 8/10 |
| 143 | 커뮤니티 |
Running the uncensored Qwen3.8-27B (HauhauCS) on a 4090 at 262K context and ~130 tok/s
4090 GPU에서 Qwen3.8-27B 모델을 262K 컨텍스트로 고속 구동하는 최적화 기법. |
Reddit 2026.10.09 | 8/10 |
| 144 | 커뮤니티 |
Just another purely open-weight models benchmark
도메인 전문가가 평가하고 필터링 가능한 오픈 웨이트 모델 벤치마크 사이트. |
Reddit 2026.10.09 | 8/10 |
| 145 | 기업·연구소 |
Disrupting a coordinated model-distillation campaign
OpenAI가 모델 증류 공격을 탐지하고 방어 체계를 강화한 사례 분석. |
OpenAI 2026.09.30 | 8/10 |
| 146 | 기업·연구소 |
Introducing dots
복잡한 프로젝트를 지속적으로 수행하는 능동형 에이전트 'dots' 소개. |
OpenAI 2026.09.29 | 8/10 |
| 147 | 기업·연구소 |
Towards safety cases for frontier AI training
프런티어 AI 학습 과정에서의 안전성 확보를 위한 가이드라인 발표. |
OpenAI 2026.09.28 | 8/10 |
| 148 | 기업·연구소 |
Science Claude discovers a novel enzyme system with CRISPR-like repeats
Claude를 활용하여 새로운 효소 시스템을 발견한 과학적 성과. |
Anthropic 2026.09.23 | 8/10 |
| 149 | 기업·연구소 |
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
Nemotron 모델을 미세조정하여 수학 및 올림피아드 문제에서 고성능을 달성한 사례. |
HF Blog 2026.10.07 | 8/10 |
| 150 | 기업·연구소 |
The Agent Said It Was Done. The Database Disagreed.
AI 에이전트의 작업 완료 보고와 데이터베이스 상태 간 불일치 문제 해결 방안. |
HF Blog 2026.10.03 | 8/10 |