LEO'S READING LIST · 2026
大模型与 Agent:20 篇值得读的论文
这不是按热度堆出来的榜单,而是一条从模型基础、训练对齐,到 RAG、Agent 与多模态的阅读路径。每篇只留一个“为什么值得读”。
20 篇 · 4 个主题01
基础模型与规模化
先理解大模型为什么能工作,以及规模、数据和计算如何共同决定效果。01查看论文02查看论文03查看论文04查看论文05查看论文
Attention Is All You Need
2017Transformer 的起点;理解注意力机制与现代大模型架构的必读论文。
Scaling Laws for Neural Language Models
2020用经验规律解释参数量、数据量和算力如何影响语言模型损失。
Training Compute-Optimal Large Language Models
2022Chinchilla 工作重新定义了给定算力下模型规模与训练数据的平衡。
LLaMA: Open and Efficient Foundation Language Models
2023理解高质量数据与高效开放基础模型路线的重要节点。
Qwen3 Technical Report
2025适合观察新一代开源模型在混合推理、多语言与 Agent 能力上的系统设计。
02
高效微调、对齐与强化学习
从低成本微调到偏好对齐,再到用强化学习激发推理能力。06查看论文07查看论文08查看论文09查看论文10查看论文11查看论文12查看论文
LoRA: Low-Rank Adaptation of Large Language Models
2021参数高效微调的经典方法,也是理解各类 Adapter 技术的好入口。
QLoRA: Efficient Finetuning of Quantized LLMs
2023把量化与 LoRA 结合,让大模型微调在有限显存下变得可行。
Training Language Models to Follow Instructions with Human Feedback
2022InstructGPT 系统呈现了 SFT、奖励模型与 RLHF 的完整对齐流程。
Self-Instruct: Aligning Language Models with Self-Generated Instructions
2022展示如何用模型自生成指令扩充对齐数据,适合数据工程实践。
Direct Preference Optimization
2023绕开奖励模型和复杂 RL 循环,理解现代偏好优化最重要的论文之一。
DeepSeekMath: Pushing the Limits of Mathematical Reasoning
2024GRPO 的代表来源,连接领域数据、持续预训练与数学推理强化学习。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL
2025观察纯强化学习如何激发自反思、验证和长链推理等涌现能力。
03
推理、工具与智能体
从思维链到工具调用,再到能协作、反思与行动的智能体系统。13查看论文14查看论文15查看论文16查看论文17查看论文
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
2022用中间推理步骤显著提升复杂任务表现,推理研究的基础读物。
ReAct: Synergizing Reasoning and Acting in Language Models
2022把推理轨迹与外部行动交织起来,奠定现代 Agent 的核心范式。
Toolformer: Language Models Can Teach Themselves to Use Tools
2023探索模型如何自监督学习何时调用工具、调用什么以及如何利用结果。
Reflexion: Language Agents with Verbal Reinforcement Learning
2023通过语言化反馈和记忆实现试错后的自我改进,适合 Agent 反思机制设计。
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
2023以可组合对话代理组织多智能体工作流,贴近实际系统搭建。
04