LLM, 모델 아키텍처, 벤치마크 관련 노트 모음
모델
| 노트 | 설명 |
|---|---|
| 2026-04-03-spreadsheet-terminal-bench | AI 에이전트 벤치마크 (Kevin Gu) |
| 2026-03-22-chatgpt-thinking-mode-model-size | ChatGPT Thinking Mode - 모델 체급에 따른 특성과 한계 |
| 2026-05-28-llm-model-release-timeline | LLM 모델 출시 타임라인 — Claude & GPT (루머 포함) |
| 2026-03-22-cloudflare-workers-ai-large-models | Cloudflare Workers AI — 엣지에서 대형 모델 실행 |
| 2026-03-22-github-trending-vllm-project-vllm-omni | vLLM Omni — 멀티모달 모델 서빙 |
| 2026-03-24-iphone-400b-llm | iPhone에서 400B LLM 구동 |
| 2026-03-26-qwen3.5-27b-claude-opus-distilled-v2 | Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2 |
| 2026-03-29-minimax-glm-kimi-coding-comparison | MiniMax m2.7 vs GLM-5.1 vs Kimi k2.5 — 코딩 성능 비교 |
| 2026-05-19-karpathy-joins-anthropic | Karpathy의 Anthropic 합류 — 의미와 파급력 |
| 2026-03-31-karpathy-litellm-dependencies-reevaluation | Golang 철학 vs Python 의존성 체인 (LiteLLM 사건 이후) |
| 2026-04-05-qwen3-6-plus | Qwen3.6-Plus |
| 2026-04-16-qwen3-6-35b-a3b | Qwen3.6-35B-A3B — Qwen의 35B 멀티모달 에이전틱 코딩 모델 |
| 2026-04-22-qwen3-6-27b-open-source-agentic-coding | Qwen3.6-27B — compact size flagship coding, terminal-level agentic coding |
| 2026-04-22-xiaomi-mimo-v2-5-open-source-agents-forward | Xiaomi MiMo-V2.5 — 오픈소스 에이전트/장기 실행 작업 강화 모델 |
| 2026-04-17-lyra-2-0 | Lyra 2.0 — 단일 이미지에서 탐색 가능한 3D 월드를 생성하는 NVIDIA 프레임워크 |
| 2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation | JoyAI-Echo — 최대 5분 멀티샷 오디오-비디오 생성 모델 |
| 2026-04-05-mac-mini-ollama-gemma4-setup | Mac mini Ollama + Gemma 4 설정 |
| 2026-04-08-gemma4-openclaw-ollama-3steps | Gemma 4 + OpenClaw 3단계 로컬 구동 |
| 2026-04-15-supergemma4-geeknews-coverage | SuperGemma4 GeekNews coverage — Gemma 4 26B 비검열/속도개선/양자화 소개 |
| 2026-04-08-claude-mythos-preview-benchmarks | Claude Mythos Preview 벤치마크 |
| 2026-04-15-fe-developer-ai-dsl-assistant | FE 개발자의 AI 활용 사례와 DSL Assistant 논문을 연결한 보존 메모 |
| 2026-04-15-anthropic-opus-4-7-ai-design-tool | Anthropic이 Opus 4.7과 함께 프롬프트 기반 디자인 툴까지 위로 확장하려는 신호 |
| 2026-04-16-claude-opus-4-7-release | Opus 4.7 정식 출시 — 코딩·장기 작업·비전 향상과 새 사이버 가드레일을 함께 발표 |
| 2026-04-26-openai-monitorability-evals | OpenAI가 CoT monitorability를 안전 평가 인프라로 공개한 데이터셋/코드 묶음 |
| 2026-07-17-openai-gpt-red | GPT-Red를 활용한 자동화 레드팀과 프롬프트 인젝션 방어 훈련 |
| 2026-04-15-gemini-3-1-flash-tts | 자연어 지시와 오디오 태그로 스타일을 제어하는 Google의 최신 TTS 모델 |
| 2026-04-16-openai-oauth-chatgpt-account-openai-api | ChatGPT/Codex OAuth 캐시를 OpenAI 호환 localhost 프록시로 재노출하는 비공식 프로젝트 |
| 2026-04-16-chatgpt-for-excel | OpenAI가 Excel 리본 안으로 들어가 자연어 기반 시트 생성·분석·수정을 제공하는 공식 애드인 |
| 2026-04-16-ai-error-analysis-automation | Sentry→n8n→Gemini→Notion으로 에러 triage를 자동화하는 운영 패턴 |
| 2026-04-16-ai-fails-without-judgment | 테스트와 자동화가 늘어도 구조 판단은 인간이 맡아야 한다는 실무 에세이 |
| 2026-04-16-cal-com-closed-source-security | Cal.com이 AI 기반 취약점 탐지를 이유로 프로덕션 제품을 닫고 Cal.diy만 MIT로 남긴 전환 사례 |
| 2026-04-16-stanford-ai-index-2026 | Stanford AI Index 2026 — 성능 가속, 미중 격차 축소, 안전·노동·환경 비용을 함께 읽는 연간 상태 보고서 |
| 2026-04-16-pi-autoresearch-geeknews | Karpathy식 autoresearch를 테스트·빌드·Lighthouse까지 확장한 범용 자율 실험 루프 정리 |
| 2026-04-20-kimi-k2-6 | Kimi K2.6 — 장기 실행 코딩, Agent Swarm, 툴 호출 안정성을 강화한 Moonshot AI의 오픈소스 모델 |
| 2026-04-25-ai-model-category-picks | 2026-04-25 기준 카테고리별 최고의 AI를 실사용 축으로 정리한 메모 |
| 2026-04-20-kimi-k2-6-vs-qwen3-6-vs-opus-4-7 | Kimi K2.6, Qwen3.6, Opus 4.7을 실무 선택 기준으로 비교한 코딩 에이전트 모델 가이드 |
| 2026-06-14-artificial-analysis-deepswe-coding-agent-index | Coding Agent Index 개편 — SWE-Bench Pro→DeepSWE 교체로 순위 재정렬, Fable 5 1위 데뷔 |
| 2026-07-12-artificial-analysis-intelligence-index | Artificial Analysis Intelligence Index v4.1 — 9개 평가 종합, 상위 50개 모델 점수 스냅샷 (1위 Fable 5 60점) |
| 2026-07-12-hada-31342-gpt-5-6-model-app-build-off | 12개 LLM의 동일 앱 생성 비교 — GPT-5.6 Sol·Claude Fable 5·Grok 4.5 |
| glm-5.2 | GLM-5.2 — Z.ai coding-first 1M 컨텍스트 모델 (2026-06-13, 벤치 미공개) |
| kimi-k2-7-code | Kimi K2.7 Code — Moonshot 코딩 특화 1T MoE 오픈웨이트 (2026-06-12) |
| claude-fable-5 | Claude Fable 5 — Anthropic 최강 코딩 모델 (2026-06-09), 미 정부 지시로 접근 중단 |
| 2026-07-18-linkedin-sujin-claude-values-models-languages | Claude의 모델·언어별 가치 표현 차이 — 따뜻함·엄밀함·깊이·솔직함 네 축과 한국어 응답 해석 |
| 2026-06-14-new-coding-models-glm-kimi-fable-opus-gpt | 신규 코딩 모델 6종 비교 — GLM-5.2·Kimi K2.7 Code vs Fable 5·Opus 4.8·GPT-5.5 |
| 2026-06-26-glm52-mac-studio-dgx-spark-benchmark | Mac Studio 512GB와 DGX Spark에서 GLM-5.2 MLX/GGUF 양자화 조합을 실행한 로컬 벤치마크 |
| 2026-07-12-justvugg-colibri | GLM-5.2 744B MoE를 25GB RAM 소비자 기기에서 디스크 스트리밍으로 실행하는 순수 C 엔진 |
| 2026-07-17-chinese-open-model-download-share | 허깅페이스·OpenRouter·Vercel 집계로 본 중국계 오픈웨이트 모델 사용 확대 |
| 2026-07-17-pytorchkr-local-llm-gpu-hardware-guide | RTX PRO 6000 4장과 PCIe P2P를 활용한 대규모 로컬 LLM 추론 장비 구성 사례 |
| 2026-07-18-pytorchkr-topic-11283-inkling-975b-moe | Inkling — 975B 멀티모달 MoE 오픈 웨이트 모델, 사고 노력 조절과 커스터마이징 중심 |
| kimi-k3 | Kimi K3 — Moonshot 2.8T 오픈웨이트 MoE, 1M 컨텍스트·네이티브 비전·KDA 어텐션 (2026-07-16) |
2026-04-24 ~ 04-28 신규
| 노트 | 설명 |
|---|---|
| 2026-04-24-openrouter-model-pricing-comparison | OpenRouter 최근 출시 모델들의 API 가격·컨텍스트 윈도우 비교표 |
| 2026-06-26-openrouter-list-benchmarks-api-reference | OpenRouter GET /api/v1/benchmarks — Artificial Analysis·Design Arena 통합 벤치마크 API reference |
| 2026-05-08-omniroute | 무료 AI gateway, 160+ providers, 13 routing strategies |
| 2026-04-24-cloudflare-unweight-lossless-llm-compression | exponent Huffman coding으로 LLM 크기 22% 감소 — batch 1 처리량 41% 오버헤드 |
| 2026-04-24-threads-choi-openai-deepseek-v4-openweights | DeepSeek-V4 오픈웨이트 발표 — 100만 토큰·Think Max 주장, 검증 필요 |
| 2026-04-25-ai-model-category-picks | 2026-04-25 기준 카테고리별 최고 AI 모델 셀렉션 |
| 2026-04-26-nemotron-personas-korea | 국내 최초 대규모 한국어 페르소나 데이터셋 (700만 페르소나, 17억 토큰) |
| 2026-04-27-mac-96gb-llm-recommendation | Mac 96GB+ Local LLM — Qwen3.6-27B보다 DeepSeek V4 Flash MLX·Minimax M2.7 우위 |
| 2026-04-26-swiftlm-apple-silicon-inference | Apple Silicon 네이티브 MLX 추론 서버, SSD Streaming + TurboQuant |
| 2026-04-26-openai-monitorability-evals | OpenAI CoT 모니터링 기반 안전 평가 데이터셋/코드 공개 |
| 2026-04-26-local-llm-formats-comparison | MLX vs GGUF vs nvfp — 로컬 LLM 포맷별 용도·장단점 비교 |
| 2026-05-12-rapid-mlx-apple-silicon-local-ai-engine | Rapid-MLX — Apple Silicon 전용 초고속 로컬 AI 엔진 |
| 2026-05-19-whichllm | whichllm — 하드웨어 기반 로컬 LLM 추천 CLI |
| 2026-05-12-llama-cpp-ollama-lmstudio-rapid-mlx-comparison | llama.cpp / Ollama / LM Studio / Rapid-MLX 비교 노트 |
| 2026-05-28-xiaomi-mimo-v2-5-price-cut-99-percent | Xiaomi MiMo-V2.5 API 최대 99% 영구 인하 — 딥시크 겨냥 가격 경쟁 |
인프라 & 도구
| 노트 | 설명 |
|---|---|
| 2026-03-21-qmd | QMD - Query Markup Documents (온디바이스 검색 엔진) |
2026-07-18 신규 유입 (고아 정리)
| 노트 | 설명 |
|---|---|
| 2026-03-29-llm-ensemble-voting-research | 연구 결과에 따르면, 여러 Large Language Model (LLM)의 출력을 voting 방식으로 결합하는 ensemble 방식은 단일 모델보다 정확도, 견고성, 신뢰성을 유의미하게 향상시킵니다. |
| 2026-04-13-ai-expert-sources | 1. Anthropic 공식 블로그/유튜브 — Claude, 에이전트, 안전성 관련 최신 연구 2. 유튜브 ‘AI Engineer’ 채널 — AI 엔지니어링 실무 심층 콘텐츠 3. Lenny’s Podcast — 제품/성장 관점의 AI 인사이트 4. How I AI with Claire Vo — AI 실전 활용 인터뷰… |
| 2026-04-19-openmythos-recurrent-depth-transformer | Claude Mythos는 수백 개의 고유한 레이어를 쌓는 대신, 일부 레이어를 재활용하여 순간 전파(foreward pass) 동안 여러 번 실행하는 Looped Transformer일 가능성이 있다. |
| 2026-04-19-supergemma4-e4b-abliterated | 무검열(abliterated) 처리 후 성능 저하를 복구해 4~16GB VRAM에서도 구동 가능하다고 소개된 경량 로컬 LLM 모델 SuperGemma4-E4B 요약. |
| 2026-05-02-anthropic-knowledge-distilation-student-models | Anthropic이 방금 전 세계 모든 AI 기업을 공포에 빠뜨렸습니다. |
| 2026-05-06-dflash-gemma4-6x-faster | Gemma 4는 가장 최적화된 무료 오픈소스 로컬 AI로 알려져 있으며, 오래된 노트북과 스마트폰에서도 동작한다. |
| 2026-05-06-glm51-uncensored-security-test | 검열이 해제된 GLM-5.1 모델을 격리된 샌드박스 환경에서 실행하며, 모델이 자체 프로그램에 대해 보안 공격을 수행할 수 있는지 테스트했다. |
| 2026-07-03-pytorchkr-topic-11058-tabfm-zero-shot-tabular-foundation-model | Google Research가 공개한 TabFM(Tabular Foundation Model)은 표 형식 데이터의 분류와 회귀를 별도의 학습이나 하이퍼파라미터 탐색 없이 단 한 번의 순전파로 처리하는 제로샷 파운데이션 모델이다. |
| 2026-07-03-pytorchkr-topic-11065-anthropic-claude-fable-5-free-usage-promotion | Anthropic의 최상위 모델 Claude Fable 5가 미국 수출통제 조치 해제(6/30)로 7월 1일 전 세계에 재배포되었습니다. |
| 2026-07-05-all-rl-algorithms-from-scratch | All RL Algorithms from Scratch는 강화학습(RL) 알고리즘 18가지를 파이썬으로 직접 구현한 교육용 GitHub 저장소다. |
| 2026-07-07-pytorchkr-topic-11090-skillcomposer-llm-agent-skill-composition-research | 스킬 라이브러리가 커질수록 ‘어떤 스킬을, 몇 개나, 어떤 순서로 쓸지’를 정하는 조합 선택이 추론 병목이 되고 있다. |
| 2026-07-08-pytorchkr-topic-11121-xybrid-on-device-llm-voice-ai-runtime | Xybrid는 LLM, 음성 인식(ASR), 음성 합성(TTS)을 클라우드 서버가 아니라 사용자 기기에서 직접 실행하기 위한 크로스플랫폼 런타임이다. |
| 2026-07-08-pytorchkr-topic-11147-tencent-hy3-295b-open-source-moe-model | Tencent Hy3는 텐센트 훈위안(Tencent Hy, 구 Hunyuan) 팀이 공개한 Apache 2.0 라이선스의 오픈소스 대규모 언어 모델이다. |
| 2026-07-09-pytorchkr-topic-11161-deepteam-llm-agent-red-teaming-framework | DeepTeam은 LLM 애플리케이션과 AI 에이전트를 대상으로 탈옥, 프롬프트 주입, 멀티턴 공격 등을 시뮬레이션하는 오픈소스 레드팀 프레임워크다. |
| 2026-07-10-pytorchkr-soma-unified-body-layer | SOMA는 NVIDIA DAIR Lab이 제안한 통합 바디 레이어로, SMPL·SMPL-X·MHR·Anny·GarmentMeasurements 등 서로 다른 인체 파라메트릭 모델을 하나의 표준 메시와 77관절 리그로 연결한다. |
| 2026-07-10-pytorchkr-topic-11183-jobs-ai-exposure-us-job-market-visualizer | Andrej Karpathy가 공개한 jobs는 미국 노동통계국(BLS)의 Occupational Outlook Handbook이 다루는 342개 직업을 인터랙티브 트리맵으로 탐색하는 개발·연구 도구다. |
| 2026-07-12-pytorchkr-topic-11217-ai-2040-plan-a | 초지능 경쟁을 2040년까지 늦추고 연구 투명성·검증·컴퓨트 상호억제를 도입하자는 정책 권고 시나리오. |
| 2026-07-13-pytorchkr-topic-11208-talk-normal-llm | talk-normal: 어떤 LLM이든 장황한 답변을 간결하게 만드는 시스템 프롬프트 |
| 2026-07-14-pytorchkr-topic-11221-colibri-744b-moe | PyTorchKR에서 소개한 colibri-744b-moe 관련 자료를 정리한 요약 노트. |
| 2026-07-14-pytorchkr-topic-11235-lotus-llm | LOTUS: 데이터에 LLM과 에이전트 처리를 대규모로 적용하는 시맨틱 연산자 프레임워크 |
| 2026-07-15-pytorchkr-topic-11250-sensorfm-health-foundation-model | PyTorchKR에서 소개한 sensorfm-health-foundation-model 관련 자료를 정리한 요약 노트. |
| 2026-07-16-bonsai-27b-low-bit-on-device-llm | Bonsai 27B는 Qwen3.6-27B를 이진·삼진 가중치로 변환해 노트북과 스마트폰에서 실행하려는 PrismML의 저비트 LLM 연구다. |
| 2026-07-17-inkling-open-weights-model | Thinking Machines의 오픈웨이트 모델 Inkling은 최고 성능보다 토큰 효율·멀티모달 처리·파인튜닝 가능성을 앞세운다. |
| 2026-07-18-claude-fable-5-system-prompt | 비공식적으로 추출된 Claude Fable 5 제품 시스템 프롬프트의 메모리·안전·행동 설계에 관한 AI Sparkup 요약. |
2026-07-20 신규 유입 (고아 정리)
| 노트 | 설명 |
|---|---|
| 2026-07-12-artificial-analysis-gpt-5-6-intelligence-vs-cost | Artificial Analysis의 Intelligence vs Cost 차트에서 GPT-5.6 Sol·Luna가 모든 추론 강도 구간에서 Terra를 파레토 우위로 앞선다는 트윗 요약. |
| 2026-07-12-sebastian-raschka-grok-4-5-pareto-frontier | Sebastian Raschka가 Grok 4.5와 Meta Muse Spark 1.1을 추가한 지능-비용 비교 차트를 공개, Grok 4.5의 가성비를 지목. |
| 2026-07-19-aisparkup-post-14555-27b-ai-prismml | 27B급 AI 모델이 아이폰에 들어갔다 — PrismML의 압축 방식. |
| 2026-07-20-ai-frontier-ep104-gpt5-6-icml | GPT-5.6 Sol 공개와 ICML 2026 서울 현장 정리 — RSI 신호, AGI-pilled 학회, inference·칩·데이터·월드모델 생태계, 온프레미스 전환 전망. |
| 2026-07-20-aisparkup-post-14587-ai-3-1 | 밀라노 비코카대 연구 — AI 조언 접근이 가능해지자 ‘모른다’ 응답이 44%→3%로 줄고 정확도는 27%→9%로 떨어졌는데 확신도는 30%→76%로 뛴 실험 결과. |
| 2026-07-20-pytorchkr-topic-11308-nvidia-rteb-1-nemotron-3-embed-feat-rag | NVIDIA, RTEB 1위 오픈 임베딩 모델 Nemotron 3 Embed 공개 (feat. RAG, 에이전트 검색). |
| 2026-07-20-pytorchkr-topic-11311-diffusion-llm-llada-diffusiongemma | 확산 언어 모델(Diffusion LLM)의 개념과 동작에 대한 연구 정리 — LLaDA에서 DiffusionGemma까지. |
| 2026-07-20-pytorchkr-topic-11323-pike-rag-microsoft-rag | PIKE-RAG — 전문 지식과 추론으로 정확도를 높인 Microsoft의 산업용 RAG 프레임워크. |
| 2026-07-20-pytorchkr-topic-11328-2026-07-13-19-ai-ml | PyTorchKR이 7/13~19일에 소개한 이번 주 AI/ML 논문 모음. |
2026-07-20 신규 유입 (고아 정리, 3차)
| 노트 | 설명 |
|---|---|
| 2026-05-02-gpt-5-5-claude-opus-4-7-opposite-prompt-advice | OpenAI와 Anthropic이 같은 날 낸 프롬프트 엔지니어링 가이드가 서로 반대 조언을 담고 있어 개발자들이 혼란을 겪었다는 X 스레드. |
| 2026-06-30-unlimited-ocr-fixed-kv-cache-long-document-baidu | 바이두 Unlimited OCR — Reference Sliding Window Attention으로 디코더 KV 캐시를 상수로 묶어 40페이지 이상 문서를 한 번에 OCR. |
관련 MOC
- moc-chinese-llm-models — 중국 LLM 플래그십 7종 가격·특징·벤치마크 비교 (2026-05)
- moc-ai-agents
- moc-ai-coding
- moc-dev-tools