在高合规流程制造中,决定一个 Agent 生死的不是框架名和提示词技巧,而是一个更朴素的问题:进入客户、审计或标签的数值,究竟来自业务系统与代码,还是大模型根据上下文“想”出来的。
一封无法回答的审计邮件
某团队上线了报价 Agent。演示时,它能在几秒内生成措辞完整的报价函,甚至给出精确到小数点后两位的毛利率。真正的问题直到客户追问才暴露:这个成本数字来自哪个系统、哪条记录,又是谁批准的?
如果数字只是模型根据上下文生成的,它看起来合理、格式正确,系统也不会报错。这类错误最危险的地方正是“静默”:错误顺利穿过流程,直到客户、质量或审计发现。
报告很漂亮,不等于结论可追溯。
框架是容器,不是准确性的来源
状态图、工作流引擎和高封装 Agent 框架的价值,是给工程团队提供编排、状态、重试和校验的位置。它们不会自动替你建立业务真值,也不会自动决定哪些约束必须写进代码。
同一个框架里,可以让模型编造价格;也可以调用经过验证的成本服务,返回分毫不差的结果。准确性来自真值来源、确定性计算、校验和回归证据,而不是框架名称。
架构定式:确定性内核在中间,大模型在两端
入口模型把自然语言转换为结构化参数;业务内核负责实体确认、权限、规则计算和业务判定;出口模型只把已经确定的结论转成适合阅读的叙述。
提示词负责命中率,代码负责兜住后果
提示词可以提醒模型不要编价格,就像河边的一块警示牌;真正阻止错误通过的,是代码校验、权限检查和人工审批闸门。
判断标准很简单:如果违反某条约束会造成实质损害,它就必须在代码、规则或审批机制中有对应控制。只存在于提示词里的约束,是劝告,不是控制。
三条硬红线
对外数值与关键判定由代码产生
凡进入客户文件、审计材料、标签、结算或合规判断的结果,大模型只允许解释,不允许重算。
受监管记录只检索和受控填充
正式批记录、规格、标签依据等必须保留批准来源、版本和审计轨迹,不能把自由生成当作正式记录。
无回归基线,不进入生产
上线前必须有可重复运行的正向与负向用例,证明该通过的能通过、该拒绝的会被拒绝。
为什么记录边界不是设计洁癖
FDA 对膳食补充剂的 21 CFR Part 111 要求企业建立并遵循主制造记录,保存生产、检验、包装和标签等记录,并保证相关电子记录满足适用要求。由此可以推断:用于正式记录的 AI 输出必须能回到批准的规格、记录和控制流程,而不能只有一句“模型生成”。
这不是要求所有文字都由代码拼接,而是把生成与真值分开:模型可以帮助解释和起草,正式事实必须来自受控记录。
上线或外采前的十项检查
- 真值来源能定位到具体系统、对象与字段
- 所有对外数值和关键判定均由确定性服务产生
- 受监管记录没有自由生成正式版本的路径
- 实体或参数有歧义时会反问,而不是猜测
- 存在无需模型密钥也能运行的确定性回归基线
- 负向用例与正向用例同等充分
- 不可逆动作在人工签核前不产生外部副作用
- 调用、成本、延迟和错误能按节点观测
- 会话与权限按用户和组织边界隔离
- 范围外问题明确拒绝,不为了完整感凑答案
本文来自造达师项目方法与经验沉淀。涉及企业的内容均已匿名化和泛化,不披露客户身份及未经验证的量化结果。内容版本 1.0.0,更新于 2026-08-10。