从零实现训练框架在: GSM8K 上跑通 GRPO、PPO、DPO 对比实验的完整流程
本文做了一个简单的项目 grpo-llm在 GSM8K 数学推理任务上对 GRPO、PPO、DPO 做的一次受控对比。
如何估算训练一个大语言模型(LLM)所需的 GPU 数量
从这一个公式出发,就能估算训练成本、训练时间、所需的 GPU 数量,误差都在一个数量级以内。做系统方案初步设计时,这通常已经够用
RAG 生产部署清单:从 Chunk 元数据到评估集搭建
本文讨论的就是这些失败模式,以及能够避免它们的工程决策。
如何写好 DESIGN.md:让 AI 生成更贴近你的设计要求
当 AI 生成的结果逐渐贴近你的预期,你就会体会到 DESIGN.md 的价值。
为什么说多智能体系统本质上就是分布式系统
把智能体集群当作它本来就是的那种分布式系统来对待,它大部分的"AI 问题"就会变成早就知道该怎么解决的问题。
Synthefy Nori:6M 参数的表格基础模型,可以替代 XGBoost 和TabPFN-3
Nori,在零训练 (zero training) 条件下处理回归任务的表格基础模型。
Loop Engineering 到底是什么?和 Harness 差在哪里
本文解释一下它到底是什么,哪些质疑合理,哪些地方确实发生了变化。
4D Gaussian Splatting 是怎么工作的:从规范 Gaussian 到形变场的原理拆解
4D-GS 靠合适的因子分解和几个关键约束,显式表示照样能搞定时间维度,而不用牺牲让它一开始就站住脚的实时性能。
OpenSpec 三阶段工作流实操:从 Propose 到 Archive让代码返工率降到三分之一以下
这一篇讲的是 OpenSpec 在单一仓库内如何落地:一个 agent,一份代码库,三个阶段走完一个功能。
Agent Harness 到底是什么:模型之外的那层控制系统
Agent Harness 把模型的能力转化为可依赖的行为,给智能体提供工具、记忆、权限、护栏、可观测性和恢复机制。
十个 AI Agent 工作流模板,照着搭就能用
AI agent 比聊天机器人更有用的地方是聊天机器人只负责回答;而agent 会完成一整条工作
白得 2 到 3 倍加速的投机采样机制解析:草稿模型和目标模型是怎么配合的
投机采样的精妙之处在于:不改模型、不动训练、不碰权重,纯粹是利用了"验证比生成便宜"这个事实
Harness Engineering 实践案例:如何Agent 写一份行为规范
OpenAI 的 Ryan Lopopolo 那发布了一篇关于Harness 的官方文章,我们来用手头的一个任务来测试下效果怎么样。
注意力架构变迁总结:稀疏、线性、SSM、混合架构如何摆脱 O(L²) 的代价
本文将介绍四条路线的原理、经过验证的基准测试数据,以及各自目前的生产落地情况。
Polars vs Pandas 在生产 Pipeline 中的对比
Pandas 不是遗留技术,它是精准的专用工具;Polars 是另一种工作的精准专用工具。为每项工作选择合适的,不是迁移项目,是工程判断力。
UV vs pip vs Conda:Python环境管理应该怎么选
对于任何在意可维护性和可重现性的项目,请选择 uv。
用 LangGraph 改造单一 RAG 架构:让 Agent 决定调用向量、图遍历还是网络搜索
向量搜索、图遍历还是网络搜索 -- 本文介绍如何用 LangGraph 让智能体为每个问题选择合适的工具。
为什么Kriging 与高斯过程回归出自同一数学框架,但实际效果却差很远
本文将在 SPE9 数据集上跑了一套正面对比,覆盖多种 Kriging 变体、GPR 以及几个 ML 基线,还包括用 5 折和 20 折交叉验证重复了一遍,看稳定性。
百亿参数模型的并行训练:节点内张量并行、节点间数据并行
瓶颈不在于数据移动的速度,而在于内存里能存多少、以及在移动数据的同时能让 GPU 保持多忙