如何估算训练一个大语言模型(LLM)所需的 GPU 数量
从这一个公式出发,就能估算训练成本、训练时间、所需的 GPU 数量,误差都在一个数量级以内。做系统方案初步设计时,这通常已经够用
RAG 生产部署清单:从 Chunk 元数据到评估集搭建
本文讨论的就是这些失败模式,以及能够避免它们的工程决策。
如何写好 DESIGN.md:让 AI 生成更贴近你的设计要求
当 AI 生成的结果逐渐贴近你的预期,你就会体会到 DESIGN.md 的价值。
为什么说多智能体系统本质上就是分布式系统
把智能体集群当作它本来就是的那种分布式系统来对待,它大部分的"AI 问题"就会变成早就知道该怎么解决的问题。
Loop Engineering 到底是什么?和 Harness 差在哪里
本文解释一下它到底是什么,哪些质疑合理,哪些地方确实发生了变化。
OpenSpec 三阶段工作流实操:从 Propose 到 Archive让代码返工率降到三分之一以下
这一篇讲的是 OpenSpec 在单一仓库内如何落地:一个 agent,一份代码库,三个阶段走完一个功能。
Agent Harness 到底是什么:模型之外的那层控制系统
Agent Harness 把模型的能力转化为可依赖的行为,给智能体提供工具、记忆、权限、护栏、可观测性和恢复机制。
十个 AI Agent 工作流模板,照着搭就能用
AI agent 比聊天机器人更有用的地方是聊天机器人只负责回答;而agent 会完成一整条工作
白得 2 到 3 倍加速的投机采样机制解析:草稿模型和目标模型是怎么配合的
投机采样的精妙之处在于:不改模型、不动训练、不碰权重,纯粹是利用了"验证比生成便宜"这个事实
Harness Engineering 实践案例:如何Agent 写一份行为规范
OpenAI 的 Ryan Lopopolo 那发布了一篇关于Harness 的官方文章,我们来用手头的一个任务来测试下效果怎么样。
注意力架构变迁总结:稀疏、线性、SSM、混合架构如何摆脱 O(L²) 的代价
本文将介绍四条路线的原理、经过验证的基准测试数据,以及各自目前的生产落地情况。
AI Agent的三重记忆机制:打造高可用的多维记忆系统
本文是一份实用指南,帮助你选择合适的记忆层。
2026 年开源 Agent 工具包选型指南:延迟、审计、可移植性与语言栈
2026 年用于构建 agent 的开源工具包已经已经得到了巨大的发展,所以本篇文章将从以下角度来帮助你如何选择最适合你的工具:延迟预算、审计追踪、模型可移植性、还是语言栈。
Orchestrator 为什么比 Agentic Loop 快:LLM 决策与执行分离的架构解析
Agentic loop 适合前期的探索工作,而Orchestrator 适合生产。
Prompt Engineering 的本质:角色、任务、上下文、格式、约束
Prompt engineering 就是用来填这个坑的,它是一种和 AI 系统沟通的方法——表达得足够清晰、足够精确,让模型的第一反应就了解你的真实意图。
视频 RAG 中分块策略:基于停顿、滑动窗口与基于 LLM 的方法
文本的RAG我们都已经很熟悉了,但是如果数据以原始视频转录文本的形式存储,没有合适的时间结构,那么相比标准的 PDF 或文本文档,如何检索视频里面的内容呢?
lat.md:将任意项目代码转换为可查询的知识图谱
lat.md让我们不再停留在“搜索”信息,而是面向一张组织有序、经过校验的项目地图。把笔记直接挂到代码上,再让它们的一致性接受自动校验,AI 工具因此变得更聪明、更可靠。
四种无向量RAG 方案实测:BM25、GraphRAG、Tree Search、Agent
四种方法都查这一份数据集,但每种方法分别使用刻意挑选、能发挥其长处的查询。得到的结果是:没有任何一种方法是通用的。