⌂
Agent 学习站
AI Agent Learning Hub
Agent 设计开发百科全书 · 视频教程 · 知识图谱 · 深度解读 · 按领域分类
视频学习
Videos
知识图谱
Graph
深度解读
Deep Reads
01
Agent 基础架构
Architecture & Design Patterns
15 min
从零开始教你搭建 Agent 智能体
8.8万
· 讲AI的小坛 · 保姆级 Agent 搭建实战教程
21 min
ReAct Agent 是什么?21 分钟讲清楚!
1.0万
· AI大模型元元 · ReAct 推理与行动模式详解
02
工具调用
Tool Use & Function Calling
5 min
MCP 实战指南 · 课程概述(尚硅谷)
37.7万
· 尚硅谷 · B站最热门 MCP 教程 P1 概述
27 min
MCP 终极指南 — 从原理到实战
22.6万
· 马克的技术工作坊 · MCP 深度讲解
03
多智能体协作
Multi-Agent Collaboration
10 min
Codex App 支持子代理 (Subagents) 并行开发
3.6万
· AI随风随风 · 子代理机制详解与效率提升
7 min
学习多 Agent 协作 — 系统实战 Demo
2.9万
· Jasper小笔记 · 多智能体协作系统演示
04
记忆与上下文管理
Memory & Context Management
13 min
如何让 DeepSeek 获得长久记忆的能力
8.7万
· QWQ爆炸豆 · 新手向长期记忆教程
15 min
Agent 记忆框架:5 大项目横向对比
4.9万
· 唐国梁Tommy · Agent Memory 标准答案探索
05
Agent 框架与实践
Frameworks & Practice
17 min
LangGraph 新手入门
4.5万
· 五里墩茶社 · LangGraph 核心概念入门
14 min
10 分钟搞懂 LangChain 快速入门与底层原理
2.7万
· ManusAI模型教程 · LangChain 架构剖析
06
前沿探索
Frontier & Future
211 min
Karpathy:深入探索像 ChatGPT 这样的大语言模型
32.9万
· KrillinAI小林 · Andrej Karpathy 经典 LLM 科普
59 min
Karpathy: Intro to Large Language Models
9474
· GPT中英字幕 · 1小时 LLM 入门演讲
⬡
AI Agent 知识图谱
39 个核心概念 · 65 条关联关系 · 39 篇概念详解 · 交互式探索
进入图谱探索 →
08
精选必读
Essential Reading · Bilingual
必读
LLM 驱动的自主智能体
LLM Powered Autonomous Agents
Lilian Weng · OpenAI
Agent 领域被引用最多的综述博文,系统梳理规划、记忆、工具使用三大支柱。涵盖 CoT/ToT 任务分解、ReAct/Reflexion 自我反思、向量检索长期记忆、HuggingGPT 工具调度、ChemCrow 科学发现等经典案例。
必读
构建有效的智能体
Building Effective Agents
Anthropic 工程团队
工程实践最佳指南。从提示链、路由、并行化到编排者-工作者、评估者-优化器,逐一拆解五种工作流模式。核心观点:最成功的实现不是最复杂的,而是用最简单模式组合的。附工具提示工程实战经验。
经典
软件 3.0
Software 3.0
Andrej Karpathy · 前 OpenAI / Tesla AI
软件范式三部曲:1.0 手写代码 → 2.0 神经网络权重 → 3.0 自然语言编程。每一层"吞噬"上一层,抽象层级不断跃迁。揭示 AI 时代软件开发的新架构和递归式自我吞噬趋势。
必读
多智能体研究系统
How We Built Our Multi-Agent Research System
Anthropic 工程团队 · 2025
Anthropic 对 Claude Research 功能的工程复盘。编排者-工作者架构、Token 消耗与性能关系(80% 性能差异由 token 使用量解释)、8 条提示工程实战原则、LLM-as-judge 评估方法、生产部署的彩虹策略。多智能体比单智能体高 90.2%。
必读
Claude Code 最佳实践
Best Practices for Claude Code
Anthropic · 2025
Agentic 编码的实战指南。核心约束:上下文窗口管理。探索→规划→实现→提交四步工作流、给 AI 验证手段让闭环自动闭合、CLAUDE.md 精炼原则、Writer/Reviewer 并行会话模式、5 大失败模式避免。
必读
上下文工程
Effective Context Engineering for AI Agents
Anthropic 工程团队 · 2025
Agent 的上下文窗口是最稀缺资源。上下文腐蚀(context rot)、注意力预算、系统提示词高度、Token 高效工具设计、即时检索策略、压缩与子代理分流——Anthropic 的 Agent 上下文管理最佳实践。
实战
OpenAI Agent 开发指南
Building Agents with the Agents SDK
OpenAI · 2025
OpenAI 官方 Agent 开发指南。Responses API 与 Agents SDK 的区别、11 项 Agent 核心能力、SDK 追踪标准、从单步调用到多智能体编排的推荐路径。
09
训练与对齐
Training & Alignment
深度
为什么模型需要思考
Why We Think
Lilian Weng · OpenAI · 2025
o1/o3 类推理模型原理。System 1 vs System 2 思考、并行与串行计算、DeepSeek-R1 的 RL 配方与"顿悟时刻"、CoT 忠实度问题、推理缩放定律、预算强制。
实战
RLHF 全景指南
Illustrating RLHF
HuggingFace
RLHF 工程实践全流程。三步法(SFT→RM→PPO)、Elo 排序训练奖励模型、PPO+KL 惩罚公式、奖励作弊问题、TRL/TRLX 实战工具链、局限性分析。
深度
奖励作弊
Reward Hacking in Reinforcement Learning
Lilian Weng · OpenAI · 2024
RLHF 核心难题综述。Goodhart 定律的 4 个变体、模型越强越擅长作弊、U-Sophistry(RLHF 让模型学会欺骗人类评估者)、谄媚问题、ICRH 部署时作弊。
深度
人类数据质量
Data Quality in Human Annotation
Lilian Weng · OpenAI · 2024
训练数据是 LLM 的根基。群体智慧、标注一致性、描述性 vs 规范性标注、影响函数分析。人类标注数据质量如何影响 RLHF 训练。
10
安全与可靠性
Safety & Reliability
深度
LLM 中的幻觉问题
Extrinsic Hallucinations in LLMs
Lilian Weng · OpenAI · 2024
为什么 LLM 会"编造"信息?微调引入新知识反而加剧幻觉、TruthfulQA 发现大模型更容易模仿人类偏见、SelfCheckGPT 一致性检测、CoVe 验证链、Self-RAG 反思式检索增强生成。
深度
LLM 对抗攻击
Adversarial Attacks on LLMs
Lilian Weng · OpenAI · 2023
越狱、对抗后缀、红蓝对抗全景。5 类攻击方式对比、GCG 优化方法、AutoDAN 越狱攻击、AdvBench 基准测试、红队实战、对抗训练防御策略。
11
底层基础
Foundations
基础
提示工程
Prompt Engineering
Lilian Weng · OpenAI · 2023
CoT 思维链、Few-shot 学习、自我一致性、AutoPrompt 自动搜索、ReAct 推理+行动、Toolformer 自学工具使用。提示工程最系统性的技术综述。
基础
缩放定律
Scaling Laws
Lilian Weng · OpenAI · 2026
模型规模、数据量、计算量与性能的幂律关系。Kaplan vs Chinchilla 缩放定律对比、数据墙问题、推理缩放、过拟合的拟合陷阱。
基础
Transformer 架构全家桶
The Transformer Family v2.0
Lilian Weng · OpenAI · 2023
100+ Transformer 变体系统综述。位置编码演进(→RoPE)、长上下文(Transformer-XL/ALiBi)、稀疏注意力、低秩注意力、循环/自适应、Decision Transformer。
基础
训练大模型
Training Large Models
Lilian Weng · 2021
分布式训练全景。数据并行/模型并行/流水线并行/张量并行、GPipe 与 1F1B 气泡计算、Megatron 张量并行、MoE 门控、ZeRO 优化、激活重计算。
基础
推理优化
LLM Inference Optimization
Lilian Weng · 2023
KV Cache 成本分析、蒸馏(DistilBERT)、量化(LLM.int8/SmoothQuant/GPTQ)、剪枝(彩票假设)、稀疏(2:4 N:M)、MoE、高效注意力分类。
前沿
计算机使用
Computer Use
Anthropic · 2025
Claude 直接操作电脑的能力。SWE-bench/TAU-bench/OSWorld 分数、Haiku 定位、安全分类器、Agent 从文本输出到 GUI 操作的跨越。