llm-harness-agent
Health Warn
- License — License: NOASSERTION
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Low visibility — Only 8 GitHub stars
Code Warn
- network request — Outbound network request in references/deepseek_papers/html/worker.js
Permissions Pass
- Permissions — No dangerous permissions requested
No AI report is available for this listing yet.
从零构建的 LLM Agent Harness 实践项目——Agent Loop、Tool Use、Context Engineering、Memory
LLM + Harness = Agent
从模型能力到可验证 Agent 系统——基于长期实践、源码审计与可证伪实验的理论框架
TL;DR
- 模型能力不等于产品能力。同一个模型经过不同的上下文、工具、权限、状态与验证机制,会表现出不同的可靠性、成本和用户体验。
- Harness 是模型与真实世界之间的协议层、控制层和证据层。它既可能放大模型能力,也可能引入新的错误,因此必须基于固定源码、协议测试和任务 benchmark 评估。
- 本仓库发布一条「可靠长程智能体」博士研究论文系列(7 篇):每篇包含研究问题、可反驳假设、方法规范与对照实验协议,并随附《证据核对与实验执行说明》。写作与内部自查已完成,未执行正式实验、不含实验结果。
- 本仓库是研究、产品规格、架构决策与实验摘要知识库,不是当前 DeepSeekAgent Runtime 的完整可执行代码仓库,也不单独证明生产版本已经发布。
- 当前生产发布状态以
STATUS.md和stage-gates.json为准。缺少实际 Runtime commit、tag、artifact、checksum 和平台矩阵时,Production Release Gate 保持未验证。
研究程序:可靠长程智能体(7 篇)
当前状态:写作与内部自查已完成;未执行正式实验,不含实验结果。 合计 7 篇 · 59,325 汉字 · 72 条参考文献条目,逐篇结构检查 0 错误(机器可读记录)。
| # | 论文要回答的问题 | 规模 | 稿件 |
|---|---|---|---|
| 01 | 需求变化后,怎样只修正真正受影响的计划,同时不漏掉下游步骤? | 9,707 汉字 · 11 refs | 正文 · 执行说明 |
| 02 | 不同编程智能体的扩展机制,在能力、权限和迁移上能否等价? | 7,097 汉字 · 10 refs | 正文 · 执行说明 |
| 03 | 历史记忆冲突、过期或被撤销时,智能体该如何选择上下文? | 8,267 汉字 · 11 refs | 正文 · 执行说明 |
| 04 | 行动后检查与反思是否真的修正错误,并降低后续复发? | 8,607 汉字 · 10 refs | 正文 · 执行说明 |
| 05 | 智能体说“已完成”时,怎样让结论、证据和实际业务状态可核对? | 7,710 汉字 · 10 refs | 正文 · 执行说明 |
| 06 | 教育智能体如何持续帮助学习者,同时让帮助逐渐退出、能力留在学习者身上? | 8,306 汉字 · 10 refs | 正文 · 执行说明 |
| 07 | 规则、认识状态与反馈三个组件合用时,是互补还是互相拖累? | 9,631 汉字 · 10 refs | 正文 · 执行说明 |
入口:系列总览(分工、推进顺序、自查报告与可重跑检查脚本) · English index(含英文摘要)
与创新点的相邻关系(示例,非一一对应):I-06 PlanGraph ↔ 第 01 篇;I-12 Memory 粒度 ↔ 第 03 篇;I-01 加固闭环 ↔ 第 04 篇;I-11 可追溯 Checkpoint ↔ 第 05 篇。
当前产品化入口
| 文档 | 用途 |
|---|---|
| 项目状态真源 | 判断本仓库能确认什么、产品发布还缺哪些外部证据 |
| 中文表达与术语表 | 解释 release artifact、production gate、checksum、runtime 等术语 |
| PRD TechPlan | 产品范围、PRD、技术方案、release gates 和决策记录 |
| Blueprint 交接包 | 历史阶段、证据链和调研入口;其中旧状态必须服从当前状态真源 |
阅读顺序:先读 STATUS.md 判断当前事实,再读 PRD TechPlan 理解产品方向,最后回到 Blueprint 追溯历史证据。
核心架构
┌──────────────────────────────────────────────────────────────┐
│ │
│ LLM(概率推理引擎) Harness Runtime(控制与证据系统) │
│ ───────────── ───────────────────── │
│ │
│ 理解用户意图 ──→ 持久记忆(Memory) │
│ 生成代码/文本 ──→ 工具与权限(Tools + Policy) │
│ 逻辑推理 ──→ 状态与编排(State + Orchestrator) │
│ 模式识别 ──→ Checkpoint 与验证(Evidence) │
│ 模型路由与成本遥测 │
│ 沙箱、恢复与审查 │
│ 上下文编译与压缩 │
│ │
└──────────────────────────────────────────────────────────────┘
一句话:模型负责概率性理解与生成,Harness 负责上下文、工具、权限、状态、执行和证据。CPU/操作系统类比便于理解,但不能代替真实协议与运行时分析。
导航
研究程序
| 文档 | 用途 |
|---|---|
| 可靠长程智能体论文系列(7 篇) | 方法与研究协议初稿:逐篇研究问题、判据、实验设计与证据说明 |
| English research index | 英文索引:7 篇标题、问题与英文摘要 |
| 系列自查报告 | 内部质量记录:结构检查、已修正问题与系列一致性规则 |
推荐先读
| 文章 | 用途 |
|---|---|
| DeepSeek Agent 理论总纲 | 从模型、上下文、工具、编排和证据五层理解产品理论 |
| 研究方法与事实校准 | 区分源码事实、官方声明、工程推论、实验观察和未找到实现 |
| 协议与 Prefix Cache 实证报告 | 查看历史实验边界、已证实项和未证实项 |
| Benchmark Harness 计划 | 历史实验设计、验收门槛与结果决策树;不是当前唯一执行任务 |
| 产品对比 | 理解不同 Agent 产品的实现边界与适用场景 |
核心创新点
下列文章包含源码观察、设计提案和待验证假设。文章标题中的机制名称不等于已经完成公开 benchmark 或生产实现。
| # | 文章 | 当前准确定位 |
|---|---|---|
| 01 | Agent 加固闭环 | 把违规事件转化为可测试、可审批、可回滚的系统改进 |
| 02 | 模型元请求 | 模型声明上下文、工具、审查和升级需求,Runtime 保留控制权 |
| 03 | 上下文分配 | 用可验证的上下文与证据控制替代未经支持的 1/L 稀释定律 |
| 04 | 稳定约束与可压缩历史分区 | 分离保留、遵守、强制执行和 Provider Cache |
| 05 | Agent 可读文档结构 | 版本化摘要、稳定章节 ID、Evidence Index 和分层读取 |
| 06 | PlanGraph | Node、Typed Edge、Acceptance、Evidence 和级联失效 |
| 07 | 风险与证据审查路由 | 根据风险、可逆性、影响范围和证据完整性选择审查模式 |
| 08 | 范围变更治理 | 区分产品范围扩张与实现依赖发现 |
| 09 | 受治理的 Skill 供应链 | 来源、权限、测试、审批、Canary、监控与回滚 |
| 10 | 意图→策略路由 | 基于 OMO/Hermes 已观察机制扩展出的 7+1 设计提案 |
| 11 | 可追溯 Checkpoint | 版本化状态、Evidence Ref、失效 Verdict 和幂等恢复 |
| 12 | 按 Scope 编译 Memory | 来源、范围、置信度、有效期、隐私和用户控制 |
| 13 | 受约束的 Byte Stability | Canonical Segment 与显式失效,正确性和安全优先 |
| 14 | Reasoning Replay Policy | 按 Provider、Endpoint、Tool State 和协议证据决定回传策略 |
| 15 | DSML 编码层研究 | 内部编码表示不等于客户端 DSML 协议 |
| 16 | Quick Instruction Capability Probe | 编码证据存在,公共 API 可用性仍需验证 |
| 17 | 推理策略与预算 | 分离参数接受、语义生效和任务收益 |
| 18 | 动态上下文位置实验 | 来源、Trust、Scope、TTL 和隐私比位置口号更重要 |
产品分析
| 文章 | 内容 |
|---|---|
| 9 款 Agent 产品校准对比 | Hermes / Claude Code / OpenCode / Codex / OpenClaw / Cursor / Coze / pi agent / CodeWhale 的校准对比 |
| DeepSeek-Reasonix 深度分析 | Reasonix 源码级分析、边界和可借鉴机制 |
关于我
袁成路。DeepinOS 开源社区十年,编程猫产品总监 → 迷你编程创始人。
现在用多台机器运行 Agent 矩阵,持续研究模型、Harness、工具、Memory、Skills、上下文和证据系统如何共同影响真实任务结果。
我相信 LLM + Harness = Agent。模型和 Harness 会共同演进,但任何强结论都应能够回到固定源码、协议、实验和任务证据。
当前公开推进:「可靠长程智能体」博士研究论文系列(7 篇)——先把方法变成可证伪的协议,再运行实验、按真实结果重写结论。
参与讨论
- 深度技术交流 / 工作机会:[email protected]
- GitHub Issue:对任何创新点有不同看法,可提交反例、源码证据或复现实验
- 协议:CC BY-NC-SA 4.0 — 允许非商业分享和改编,需署名并以相同方式共享。详见 CONTRIBUTING.md
本仓库优先区分“已经看到什么、据此推断什么、准备验证什么”。稳定信息与变化信息分区是一条重要设计线索,但不是无需实验的普遍定律。
Reviews (0)
Sign in to leave a review.
Leave a reviewNo results found