Framework Ready
框架已经 Ready。
Internal review · 30 min · ChemAgent
ChemAgent 实战复盘
Chapter 01 / Recap
01.1 / 当时的进度
01.2 / 当时的判断
框架已经 Ready。
下一步是继续运行剩余 Case,在测试过程中发现并修复 Bug。
完成测试验收,达到 Production Ready。
Chapter 02 / Reality Check
02.1 / Problem 01—02
从简单 Case 进入完整能力后,失败不再对应一个明确环节 - 谁能想到,一个Case花掉3天时间Debug?
核心问题完整链路同时启动,失败千头万绪,难以快速定位根因。
一次复杂 E2E 需要走完整任务链,任何修改都意味着重新等待 - 等待时长~20分钟!
核心问题运行成本高、反馈周期长,团队反复经历“失败 → 更新 → 重跑”。
02.2 / Problem 03—04
公共逻辑发生变化后,已经建立的历史能力出现向后回归 - 一个一个PR回归,又3天过去了!
核心问题系统缺少自动回归保护和变更影响分析。
前一个 Case 修复后,后一个 Case 仍然出现相似问题 - AI真的很喜欢偷懒,永远热爱“打补丁”+“Hard Code”。
核心问题样本级修复没有抽象成适用于同类任务的系统能力。
02.3 / Problem 05—06
系统声称成功、真实执行和专业正确之间存在多层断点 - 直到昨天,我还在发现假阳案例!
核心问题缺少从意图到结果、从执行到专业指标的完整证据链。
现有 Case 主要覆盖精馏工艺从简单到复杂这一条业务轴线 - 这个Case通过了,这项能力就达标了吗?No!
核心问题业务复杂度不能替代完整的系统验证空间。
02.5 / 阶段性反思
适用阶段:系统已经 Ready,需要通过用户任务进行业务验收。因此,31 个 Case 可以扮演业务验收场景库的角色。
适用阶段:复杂系统,离 Ready 距离遥远——就是实际所处阶段!31 个 Case 的测试同时暴露了验收体系和产品本身的双重问题。
Chapter 03 / Industry Research
03.1 / Eval Objects & Research
03.2 / Iteration Mechanisms & Research
03.3 / Domain Assembly
Why / 为什么?
不同研究分别评回答、轨迹、状态、领域结果或可靠性,没有一项覆盖完整证据链。
有些只负责测量,有些优化 Prompt,有些搜索 Workflow,有些负责发布治理,没有一项同时完成归因、改造、泛化和认证。
不同方法对 Ground Truth、运行成本、环境稳定性和风险容忍度的假设不同。
工程可行性、仿真有效性、专业约束和安全风险必须由具体领域定义。
现有方法并非不能使用,而是分别解决局部问题;直接照搬容易获得局部高分,却无法形成完整的 Production 证据。
Chapter 04 / Build the Loop
04.1 / Agent Type & Characteristics
ChemAgent 可以定义为:使用专业工具(Tool Use)、以工业仿真为事实基础(Simulation-grounded)的科学与工程 Agent(Scientific and Engineering Agent)。
应用类别:面向专业科学与工程任务。
交互和执行方式:通过专业工具改变外部系统状态。
事实依据:最终结果以工业仿真而不是语言生成作为判定基础。
Main Characteristics / 主要特征
自然语言有歧义,Agent 的规划和输出具有概率性。
Agent 需要调用专业工具、修改外部状态,错误会沿任务链传播。
正确调用工具不等于真实写入;仿真收敛不等于目标达成;数值达标不等于工程合理和安全。
E2E 成本高,同时需要证明泛化、可复现和无历史回归。
04.2 / Engineering Objective
不是让 Agent “通过更多 Case”,而是:在明确的使用场景与风险边界内,把偶然成功的 Agent,升级为能力可验证、结果可复现、表现可泛化、风险可控制,并且可以持续发布和运营的产品。
因此,Eval 驱动的工程化闭环需要依次完成四项任务:
04.3 / Six-stage Eval Loop
每一阶段都回答一个不同问题,并留下可以进入下一阶段的工程产物。
产品需要具备什么能力?前提和边界是什么?
应用于 ChemAgent定义 Use Template、Edit Template、From Scratch 各自的适用条件、行为和边界。
用哪些具体场景证明能力?每个 Case 凭什么算通过?
应用于 ChemAgent将原 31 个 Case 映射到能力地图,补充边界、异常、泛化和回归 Case,并定义意图、路径、写入、仿真、结果与风险证据。
如何以适当成本运行 Case 并取得证据?
应用于 ChemAgent同一个业务 Case 不再只跑完整 E2E,而是使用契约测试、无 LLM 流程、Aspen 探针和自然语言 E2E 逐层验证。
失败是 Bug、定义缺失、架构问题、工程不可行还是能力边界?
应用于 ChemAgent单位问题进入公共单位契约并增加回归 Case;参数写入问题增加状态回读;不可行任务形成明确边界。
Case Family 是否足以证明能力已经泛化、稳定且没有破坏历史能力?
应用于 ChemAgent不再以单个 Case 变绿为完成标准,而是由一组同能力 Case 共同认证。
真实环境是否产生了新能力、新场景和新失败?
应用于 ChemAgent将真实复杂任务和 Production 异常转化为新的能力定义与回归测试。
Chapter 05 / Current Status
ChemAgent 现在如何了?