在高合规流程制造中,决定一个 Agent 生死的不是框架名和提示词技巧,而是一个更朴素的问题:进入客户、审计或标签的数值,究竟来自业务系统与代码,还是大模型根据上下文“想”出来的。

01

一封无法回答的审计邮件

某团队上线了报价 Agent。演示时,它能在几秒内生成措辞完整的报价函,甚至给出精确到小数点后两位的毛利率。真正的问题直到客户追问才暴露:这个成本数字来自哪个系统、哪条记录,又是谁批准的?

如果数字只是模型根据上下文生成的,它看起来合理、格式正确,系统也不会报错。这类错误最危险的地方正是“静默”:错误顺利穿过流程,直到客户、质量或审计发现。

报告很漂亮,不等于结论可追溯。
02

框架是容器,不是准确性的来源

状态图、工作流引擎和高封装 Agent 框架的价值,是给工程团队提供编排、状态、重试和校验的位置。它们不会自动替你建立业务真值,也不会自动决定哪些约束必须写进代码。

同一个框架里,可以让模型编造价格;也可以调用经过验证的成本服务,返回分毫不差的结果。准确性来自真值来源、确定性计算、校验和回归证据,而不是框架名称。

03

架构定式:确定性内核在中间,大模型在两端

入口模型把自然语言转换为结构化参数;业务内核负责实体确认、权限、规则计算和业务判定;出口模型只把已经确定的结论转成适合阅读的叙述。

入口大模型、确定性业务内核、人工审批闸门和出口大模型组成的架构
同一组结构化参数必须得到同一结果;大模型不得越过内核重算结论。
04

提示词负责命中率,代码负责兜住后果

提示词可以提醒模型不要编价格,就像河边的一块警示牌;真正阻止错误通过的,是代码校验、权限检查和人工审批闸门。

判断标准很简单:如果违反某条约束会造成实质损害,它就必须在代码、规则或审批机制中有对应控制。只存在于提示词里的约束,是劝告,不是控制。

提示词像警示牌,代码像能拦截错误结果的闸门
提示词改善概率,确定性控制限制后果。
05

三条硬红线

01

对外数值与关键判定由代码产生

凡进入客户文件、审计材料、标签、结算或合规判断的结果,大模型只允许解释,不允许重算。

02

受监管记录只检索和受控填充

正式批记录、规格、标签依据等必须保留批准来源、版本和审计轨迹,不能把自由生成当作正式记录。

03

无回归基线,不进入生产

上线前必须有可重复运行的正向与负向用例,证明该通过的能通过、该拒绝的会被拒绝。

06

为什么记录边界不是设计洁癖

FDA 对膳食补充剂的 21 CFR Part 111 要求企业建立并遵循主制造记录,保存生产、检验、包装和标签等记录,并保证相关电子记录满足适用要求。由此可以推断:用于正式记录的 AI 输出必须能回到批准的规格、记录和控制流程,而不能只有一句“模型生成”。

这不是要求所有文字都由代码拼接,而是把生成与真值分开:模型可以帮助解释和起草,正式事实必须来自受控记录。

07

上线或外采前的十项检查

  • 真值来源能定位到具体系统、对象与字段
  • 所有对外数值和关键判定均由确定性服务产生
  • 受监管记录没有自由生成正式版本的路径
  • 实体或参数有歧义时会反问,而不是猜测
  • 存在无需模型密钥也能运行的确定性回归基线
  • 负向用例与正向用例同等充分
  • 不可逆动作在人工签核前不产生外部副作用
  • 调用、成本、延迟和错误能按节点观测
  • 会话与权限按用户和组织边界隔离
  • 范围外问题明确拒绝,不为了完整感凑答案
内容原则

本文来自造达师项目方法与经验沉淀。涉及企业的内容均已匿名化和泛化,不披露客户身份及未经验证的量化结果。内容版本 1.0.0,更新于 2026-08-10

公开来源U.S. Food and Drug AdministrationCurrent Good Manufacturing Practice in Manufacturing, Packaging, Labeling, or Holding Operations for Dietary Supplements