15 本 AI Agent 与 LLM Infra 实战书,免费在线读
转 AI 的工程师,卡在资料上
一位写了六七年 Node.js 的后端工程师,下了决心要往 AI 方向转。他的第一反应自然是找资料,然后大概率会在三个地方轮流碰壁。
论文这条路,arXiv 上关于 agent 的综述一周好几篇,摘要读得懂,一到公式就开始慢下来,到头来也不知道该在自己的代码里改哪一行。博客这条路,agent 教程铺天盖地,每篇解决一个点,但凑不成一条线,更普遍的是十篇里有八篇是同一份 quickstart 换了个封面又发一遍。课程这条路,价格从 99 到 6999,内容多半停在「怎么调 OpenAI 的接口」,比官方文档多出来的部分,大概只有讲师的口音。
还有一层更具体、也更折磨人的障碍,在语言上。
AI 工程的资料生态几乎完整地长在 Python 上
inferloop.dev 这个站点,恰好填的就是这个位置的空缺。

先说一套通用的筛子
在介绍它之前,先给出一套自己用了很久的判断方法。面对任何一份技术资料——书、专栏、课程、系列博客——问四个问题,答对三个以上再花时间进去。
第一问:它说不说自己不适合谁读。
一份宣称人人可读、零基础到精通的资料,作者要么心里没有具体的读者画像,要么就是在写销售文案。愿意在开篇写下「这本书不适合刚学编程的新手」这类话的作者,说明他有一条清晰的能力线,也说明他不打算靠扩大受众来撑数据。
第二问:开篇是不是一个带时间、带数字的翻车现场。
在一线踩过坑的人,讲一件事会本能地从事故切入:哪一天、账单多少、报警几点、影响几个用户。没踩过坑的人,只能从定义切入——「什么是 Agent 评测」「为什么可观测性很重要」。这两种开头,信息密度差一个量级。
第三问:每一章有没有一条能跑起来的代码路径。
五行伪代码不算。要有一个具体的目录、一个具体的文件名,照着跑能看到输出。这一条会立刻把概念整理和工程实践区分开。
第四问:有没有一节专门讲局限。
把讲解对象说得处处完美的资料,作者站的是代言人的位置。而技术判断力恰恰长在取舍里——为什么选 A 没选 B、这么选牺牲了什么、换个场景又该怎么改。这一节写得越长,说明作者读得越透。
这四问对任何技术资料都成立。下面就用它来检验一下 inferloop。
用四问检验这个书架
一、边界
站点上目前摆着 15 本书。翻开任意一本的前言,都能找到一段适合与不适合的对照清单,而且写得比多数技术书更硬。
《AI Agent 评测工程实战》的不适合清单点了四类人:纯模型训练 / RLHF 工程师、完全没调过 LLM 接口的人、想找 prompt 速查手册的人、拒绝 TypeScript 的纯 Python 用户。《源码精读》的清单更直白,其中一条是想要「今天读完明天就涨薪」的人,作者在下面补了一句:精读是慢功夫,半年读 5 章比一周读 50 篇博客有用得多。
划这种线,代价是主动放弃一部分读者。愿意付这个代价,第一问算过。
二、事故
翻了几本书的开篇,模式相当一致。
《AI Token 中转站实战》从一笔 8 万元的账单讲起:财务问这个月的 OpenAI 花销能不能拆到每个团队,后台看了五分钟,答案是拆不出来,因为所有业务线共用同一把上游 Key;两周后,一名新同事把这把 Key 提交到了公开仓库,安全团队要求立刻吊销,公司里所有依赖 LLM 的服务在那一刻同时下线,40 分钟后才全部恢复。
《AI Agent 评测工程实战》的开篇是一次接口回归:退款工具的签名从 (orderId, reason) 加了一个必填参数 amount,第二天客服后台收到 11 起异常工单——用户被退了 0 元。
《Agent Harness 评测工程》讲 pass^k 的那一章,开篇落在凌晨两点:值班助手把一个该升级的故障自己重启了,重启没解决,又重启,来回三次才有人接管。作者把线上 trace 拉下来,对着回归集里一模一样的那条任务重跑,过了;再跑,过了;跑到第六次才复现——检索返回的手册片段里,「先尝试重启」这句偶然排在「若 5 分钟未恢复则升级」前面,模型读到前半句就动手了。
回归集只跑一次,六次里有五次会让这个问题溜进生产。
这一章接着把它量化。pass@k 是 k 次里至少一次成功的概率,衡量能力上界;pass^k 是 k 次全部成功的概率,衡量可靠性下界。单次成功率 0.9 看着不错,连续五次全对的概率只有 0.59。对一个无人值守、自己动手改生产配置的助手,该看的是后面那个数。

第二问过了,而且这些故事的颗粒度,不像编出来的。
三、代码
站内有 100 多个章节页带着 examples/ 的具体路径。上面那章 pass^k 开头就写清楚了三个阶段各自落在哪:examples/12-passk-flakiness/ 下的 repeat-run.ts、passk.ts、stability.ts。《AI Agent 评测工程实战》配了一套 EvalKit 框架、390 条评测集、一个 mock LLM server 和 ShopAgent 主线项目。每本书的源码都在 GitHub 上开着仓库。
第三问过了。
四、局限
《源码精读》给自己立了一条规矩,这可能是整个站点上最有意思的一句话:每一篇精读末尾都有一节「诚实评价 + 局限」,写满 800 到 1500 字——找不到这么多局限,就不是合格的精读,要么是我没读懂,要么是这个项目不够格被选。
前言里还有一段对现存精读文章的判断:读了一百多个开源项目的源码,99% 的精读文章不回答「换我来做会怎么改」这个问题,把作者捧得很高,把项目讲得很完美,读完读者只剩「哇好厉害」四个字,没有任何可以带走的东西。

四问全过。
书架的三条动线
15 本书摆在一起,容易看成一堆随机选题。按吸收方式重新排一下,它其实是三条动线,对应工程师学新东西的三种姿势。
造一遍。
读一遍。
量一遍。
大部分人在第一条动线上花掉 90% 的时间,第二条偶尔走走,第三条基本空白。
从「跑起来」到「跑得稳」这一步,卡住的人比卡在第一步的多得多

该说的短板
从第三方视角,就得把不好的一面也说清楚,否则前面那四问也别问了。
它很新,也很小。
它出自一个人的手,覆盖有明显偏好。
更新节奏挂在一个人身上。
它没有社区,也不打算做课。
作者在关于页里给的动机是:书是我想得到的最诚实的形式,逼着自己把每个环节都想透,再写清楚;写书的第一目的是逼自己把每个细节都搞懂,对别人有用属于顺带。这个动机解释了上面几条短板的来源,也解释了内容颗粒度为什么比常见教程细——一个人为了自己弄懂而写的东西,跟为了卖给别人而写的东西,详略取舍从根上就不一样。
一个顺手的小东西
站点顶栏里有个跟书没关系的页面,叫 AI 发音速查,收了 292 个术语。CUDA 念「库达」,不按字母拼 C-U-D-A;cuDNN 念 koo-D-N-N;NCCL 念「尼克尔」;HBM 念「艾奇比艾姆」。每条带音标、点击发音、中文谐音、一句话含义和参考链接,按算力硬件、训练微调、推理部署、模型厂商这些标签分了组。

对每天在文档里看这些词、但从来没听人念过的人,这一页的实用性,可能比某几本书还高。
最后
这个书架的规模值得记一下:15 本书,364 个章节页,正文汉字过百万,294 张 Mermaid 架构图,全部免费在线读,CC BY-NC-SA 授权,源码开在 GitHub。
放在中文 AI 工程资料的整体供给里看,它补的位置很窄——TypeScript 工程师、应用层往上、从「造一遍」到「量一遍」的完整链路。窄有窄的代价,也有窄的好处:一份东西越是为某种具体的人写的,它对这种人的用处就越难被通用资料替代。
站点地址:inferloop.dev
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名