• 中医竟是AI Harness祖师爷?


    背景:

    1. 最近一直在看中医/喝中药补身体,医生每2周去看一次,诊脉看舌苔问诊后再微调中药配比和成分。感觉这个流程很有意思。
    2. 今天在学习 AI Harness:《
      Why The Harness Matters More Than The Model | YC Paper Club》
    3. 突然灵光乍现,感觉这两者有点交集,便问了 AI 好几个问题。以下是 AI 自己根据它自己的回答总结的技术文章。
      背景完。

    一句话总结:
    传统软件工程处理的是可规定、可复现、可验证的确定性逻辑;现代 AI 处理的是从数据中归纳出来的概率性泛化。中医辨证论治,与 AI 有结构上的相似:知识不是明文规则,而是隐式经验模式;输出不是逻辑必然,而是条件分布下的高概率选择。AI Harness 最该学的,不是让模型变确定,而是用确定性外壳包住概率内核,把方差和尾部风险压到可接受范围。


    0. 摘要

    本文整理一次关于“AI 与传统软件工程最大区别”的讨论,并延伸到中医与 AI Harness 的类比。

    核心脉络如下:

    1. AI 与传统软件工程的最大区别:传统软件追求规格、代码、执行、验证的确定性闭环;AI 是数据、训练、权重、概率生成。
    2. 中医是“概率性泛化”的典型传统体系:辨证论治、方证相应、针灸配穴,都是从大量经验样本中归纳隐式模式,再对新情境做情境化判断。
    3. 中医用一套经验工程控制风险:强先验、辨证纲领、四诊合参、安全禁忌、三因制宜、复诊反馈、师承会诊、药材炮制、制度监管、现代循证。
    4. 这些手段几乎可以一一映射到 AI Harness:版本化政策包、任务路由、规则引擎、RAG、多源证据、沙箱、审批、回滚、监控、拒答转人工、案例回流。
    5. 成熟度不均:提示、路由、RAG、护栏、微调、监控、转人工已较广泛;但版本化与 eval 门禁联动、风险分层硬约束、多源证据仲裁、工具事务回滚、OOD 校准拒答、在线闭环案例回流仍不成熟。
    6. 后续优先级:先压尾部风险,再提上限。优先做版本化 + eval 门禁、风险路由 + 硬规则、工具沙箱 + 审批 + 回滚、证据分级 + 冲突仲裁 + 校准、OOD 拒答 + 转人工 + 案例回流。

    1. 起点:AI 与传统软件工程的最大区别

    传统软件工程的核心链路是:

    规格 → 代码 → 执行 → 验证

    你写下规则,系统按规则运行。相同输入、相同状态,原则上应得到相同输出。Bug 可以被定位到某一行代码、某个状态、某个依赖;正确性可以用单元测试、契约、形式化验证来逼近“布尔式”的保证。

    现代 AI,尤其是大模型,核心链路是:

    数据 → 训练 → 权重 → 概率生成

    它没有把“如果 A 则 B”的规则显式写出来,而是把统计规律压进参数里。它的输出不是逻辑推导的结果,而是对“最可能合适答案”的采样。

    因此:

    • 同一问题换个说法,答案可能变;
    • 同一输入,因采样设置不同,输出可能变;
    • 错误不是“某一行写错了”,而可能是数据偏差、分布偏移、提示敏感、幻觉;
    • 正确性很难用“满足/不满足规格”判断,只能用评估集、指标、人类反馈、线上监控来统计性判断。

    所以,最大区别不是“AI 会不会犯错”,而是“正确性是否可以被确定性地规定和复现”。

    传统软件工程追求的是:在明确边界内,行为可预测、可审计、可验证。
    AI 工程追求的是:在开放分布中,行为统计上可用、可评估、可对齐、可监控。

    工程方法也因此不同:

    维度 传统软件 AI 系统
    核心资产 代码、规格、架构 数据、权重、提示、上下文
    正确性 布尔式、可证明 统计式、可评估
    复现性 强 弱,受采样与分布影响
    错误定位 行级、状态级 数据、分布、提示、模型、工具链
    工程重点 测试、契约、版本 评估、对齐、监控、回滚

    传统软件更像“造一台按图纸运行的机器”;现代 AI 更像“训练一个在统计意义上表现良好的专家系统”。


    2. 中医:另一种“从数据中归纳出来的概率性泛化”

    如果只选一项类似,最典型的是:

    中医的辨证论治体系,尤其是经方方证与针灸配穴。

    2.1 为什么说它们和 AI 有结构同构

    不是“中医就是 AI”,而是它们的知识形态和决策方式有结构上的相似:

    层次 中医 AI
    数据层 医案、脉案、舌象、本草性味 语料、标注、日志、反馈
    模型层 六经、脏腑、经络、方证、药证 权重、隐层表示、概率分布
    输出层 同病异治、异病同治、随证治之 条件生成、采样、多候选
    验证层 复诊、反馈、调整 评估集、指标、在线监控
    传承层 师承、口诀、手感、默会知识 微调、few-shot、人类反馈

    中医看到一组症状、脉象、舌象、体质、节气,并不是在查一张固定表,而是在做模式识别:这组表现更像哪个“证”?这个证与哪些方、哪些穴、哪些加减法在历史上高频共现?

    这很像大模型从语料中压进权重的统计关联,只不过中医的“权重”藏在师承口诀、医案类比和身体记忆里。

    2.2 典型特征:同病异治、异病同治、随证治之

    同一个感冒,有人用麻黄汤,有人用银翘散,有人要扶正;同一个人,夏天和冬天不同,南方和北方不同。处方不是确定性的唯一解,而是对当前情境最可能合适的方案。

    针灸也一样:同一种病,取穴、补泻、时辰、得气反应都可能不同。

    这非常像概率生成:输出不是逻辑必然,而是条件分布下的高概率选择。

    2.3 区别也要说清

    AI 靠数学优化和大规模算力;中医靠身体感官、师徒传承和文化语境。中医并不“保证”优质结果,也没有现代统计学意义上的校准。误诊、误治、药害、“坏病”始终存在。

    所以,更准确的说法是:

    中医是一套前现代的经验工程,用强先验、结构化辨证、安全禁忌、反馈复诊和制度监管,把概率性泛化的方差和尾部风险尽量压小。


    3. 中医如何控制概率泛化的质量与风险

    中医并不保证每次高分,但它试图避免最坏结果,并在反馈中不断修正。具体手段可以分十层。

    3.1 强先验与经典约束:相当于基座模型加版本管理

    《黄帝内经》《伤寒论》《金匮要略》《神农本草经》《本草纲目》等,构成了一套强先验。后世注疏、校勘、医案,类似不断更新的训练语料和版本修订。

    尤其是“方证相应”“有是证用是方”,把很多决策压成较硬的对应关系,减少随意泛化。

    3.2 辨证纲领:相当于降维、正则化和隐变量

    八纲辨证、六经辨证、脏腑辨证、卫气营血、三焦辨证,把高维、嘈杂的症状映射到低维“证型”。

    这既像特征工程,也像正则化:防止一两个症状就过度推断。证型不是确定规则,但它让泛化有框架、有边界。

    3.3 四诊合参与置信度加权:相当于多模态融合

    望闻问切、十问歌,要求多源信息互证,不能单凭一脉一舌。遇到矛盾时,有“舍脉从证”“舍证从脉”等权衡原则,类似不同模态的置信度加权。

    目的是降低单点噪声导致的误判。

    3.4 方证相应:相当于规则引擎与约束解码

    有是证,用是方。关键动作必须满足硬规则。比如麻黄汤证要求无汗、脉浮紧,若汗出脉弱则禁用,防止误汗。

    这类似输出 JSON schema、grammar、前置条件检查。

    3.5 安全护栏与禁忌:相当于约束解码和拒绝采样

    十八反、十九畏、妊娠禁忌、毒性药炮制、先煎久煎、剂量法度、中病即止、得下即止,都是硬约束。

    大承气汤“得下即止”,类似 early stopping。这些手段不保证最优,但优先避免灾难性错误。

    3.6 三因制宜:相当于条件生成

    因时、因地、因人,强调同病异治。它承认输出不是全局唯一解,而是条件分布下的情境解。

    这能提高个体适配度,但也要求医生对上下文有准确判断。

    3.7 复诊与随证治之:相当于在线学习和反馈闭环

    《伤寒论》讲“观其脉证,知犯何逆,随证治之”,这是典型的纠错机制。还有“效不更方,无效更方”、小剂量试服、试探性治疗、复诊调方。

    中医把一次处方看作一次带反馈的干预,而不是一锤定音。

    3.8 师承、医案、会诊:相当于微调、人类反馈和集成投票

    师带徒是典型的默会知识传递,类似领域微调。医案记录成败,类似带标注的经验数据。会诊、病案讨论、流派互参,类似多模型集成,降低单个医生“模型”的偏差。

    但医案也有发表偏倚和幸存者偏差。

    3.9 道地药材与炮制规范:相当于数据治理和输入标准化

    “橘生淮南则为橘,生于淮北则为枳。”产地、采收、炮制、煎服法,都会改变药性。

    道地药材、如法炮制、药典规范,是在控制输入分布,减少数据漂移。没有这一层,再好的辨证也会被劣质药材拖垮。

    3.10 制度与伦理:相当于监管和准入

    行医资格、药肆管理、药典、师承考试、医案考核,以及“六不治”等拒治原则,都是制度性护栏。

    危重症转诊、不治已病治未病,类似分诊和拒答机制。

    3.11 现代补强:循证医学、RCT、真实世界研究、药物警戒、AI 辅助

    传统中医的这些手段,能提高稳定性和安全性,但不能像形式化验证那样给出确定性保证。

    所以现代中医必须加上随机对照试验、Meta 分析、真实世界数据、毒理与药物警戒、标准化电子病历,以及 AI 辅助决策和监控。


    4. 映射到 AI Harness:确定性外壳包裹概率内核

    4.1 什么是 AI Harness

    本文讨论的 AI Harness 取广义:

    围绕模型的运行、评估、反馈、治理脚手架:提示与策略、工具调用、状态机、护栏、评估集、监控、回滚、审计。

    核心原则一句话:

    用确定性外壳,包裹概率性内核。

    中医的“辨证论治”是概率内核;禁忌、炮制、复诊、师承、药典、制度是确定性外壳。AI Harness 也该这么干。

    4.2 一一映射表

    中医手段 AI Harness 对应 具体怎么做
    经典先验、版本注疏 系统提示、政策包、模型/数据版本 把 system prompt、工具 schema、安全策略、知识库版本化;变更必须过 eval 门禁,可回滚
    八纲、六经、脏腑辨证 任务路由、状态机、本体 先分类意图、领域、风险等级,再选模型、提示、工具和流程;高风险走慢路径
    方证相应 规则引擎、约束解码 输出 JSON schema、grammar、前置条件;关键动作必须满足硬规则
    四诊合参 多源证据融合、RAG 用户输入、检索、工具结果、记忆都带来源和置信度;冲突时按权威、时效、投票解决;强制引用
    十八反、十九畏、妊娠禁忌 安全护栏、权限控制 工具白名单、最小权限、沙箱、禁止组合、预算、超时、最大步数、kill switch
    三因制宜 上下文条件化 注入用户画像、地域、时间、合规区域;个性化但受策略约束
    复诊、随证治之 在线反馈闭环 执行后验证,失败重试、换策略、回滚;A/B、监控、告警
    师承、医案、会诊 微调、案例库、多智能体 few-shot、LoRA、专家反馈、相似案例检索;高风险用多模型投票/辩论/仲裁
    道地药材、炮制 数据治理、预处理 权威源、时效、去重、清洗、脱敏、格式规范化、嵌入模型版本管理
    药典、行医资格 治理、审计、合规 日志、trace、审计、准入评估、责任链、SLO、模型卡、数据卡
    六不治 拒答、转人工 低置信度、分布外、高风险、超出能力时转人工或拒绝
    现代补强 统计评估、红队、形式化验证 eval harness、回归门禁、校准、OOD 检测、红队、关键路径形式化验证

    4.3 具体架构流水线

    可以做成这样一条流水线:

    1. 入口层:输入规范化、脱敏、意图分类、风险评分。
    2. 路由层:按任务类型和风险选模型、提示、工具、检索源。
    3. 上下文层:RAG 检索、工具查询、记忆注入;每条证据带来源、时间、置信度。
    4. 推理层:生成计划、多候选答案、自检;高风险任务多模型投票或辩论。
    5. 约束层:schema 验证、规则引擎、权限检查、约束解码。
    6. 执行层:工具沙箱、dry-run、审批、事务、幂等、超时、回滚。
    7. 验证层:事实核查、引用检查、单元测试、模拟执行、输出过滤。
    8. 反馈层:日志、指标、用户反馈、在线评估、案例入库、定期微调。
    9. 治理层:版本管理、审计、合规、SLO、灰度、回滚、责任链。

    4.4 例子:退款 Agent

    • 入口:识别“退款”意图,风险中高。
    • 路由:走退款专用提示和工具。
    • 上下文:检索退款政策、订单历史。
    • 推理:模型生成退款方案。
    • 约束:规则引擎检查订单存在、金额≤原额、时间窗口、用户权限。
    • 执行:沙箱 dry-run,高风险转人工审批,再真实调用支付工具。
    • 验证:确认退款成功、金额正确、日志完整。
    • 反馈:失败则回滚或重试;案例入 eval 集;监控退款异常率。

    这其实就是中医的“辨证—方证—禁忌—复诊”结构。


    5. 成熟度盘点:哪些已经用了,哪些没有

    以下按头部生产系统与一般团队的成熟度判断。很多手段是“有,但很浅”。

    5.1 已经广泛应用或部分广泛应用的

    中医手段 AI Harness 对应 成熟度
    经典先验、版本注疏 system prompt、模型、知识库、工具 schema 版本化 头部广泛,小团队弱
    八纲/六经辨证 意图分类、任务路由、状态机、Agent 框架 广泛
    方证相应 JSON schema、function calling、约束解码、规则引擎 广泛
    四诊合参 RAG、多源检索、引用来源 广泛,但冲突仲裁弱
    十八反、妊娠禁忌 内容过滤、权限、沙箱、工具白名单 广泛
    三因制宜 用户画像、地域、时间、合规上下文注入 广泛但粗糙
    复诊、随证治之 日志、监控、A/B、重试 部分广泛,自动回滚少
    师承、医案、会诊 few-shot、微调、案例库 广泛;多智能体辩论生产少
    道地药材、炮制 数据清洗、去重、脱敏、格式规范 广泛但质量参差
    药典、行医资格 审计、合规、模型卡 头部广泛,小团队少
    六不治 拒答、转人工 广泛
    现代补强 离线 eval、红队 头部广泛,形式化验证少

    一句话:“提示、路由、RAG、护栏、微调、监控、转人工”已经广泛;但把它们串成严格闭环和门禁的很少。

    5.2 还没有广泛应用或很不成熟的

    1. 版本化政策包 + eval 门禁联动:很多团队改 prompt、换模型、换知识库不上回归测试,也不强制灰度回滚。
    2. 风险分层路由 + 硬规则全覆盖:有意图分类,但高风险任务没有强制走慢路径、规则引擎和人工审批。
    3. 多源证据的权威分级、时效加权、冲突仲裁、置信度校准:RAG 有引用,但来源谁更权威、冲突时听谁、置信度是否校准,普遍弱。
    4. 工具组合安全、dry-run、事务回滚:单工具权限有,多工具组合风险、预执行、幂等、回滚不系统。
    5. OOD 检测与校准驱动的拒答转人工:拒答有,但很多靠关键词或阈值,不是校准后的分布外检测。
    6. 在线闭环自动诊断、策略切换、案例回流:监控有,自动定位失败、换策略、回滚、把失败案例回流到 eval/训练集,少。
    7. 多模型集成/辩论/仲裁用于高风险:研究多,生产少。
    8. 数据漂移、嵌入模型版本、输入分布监控:数据治理有,但漂移监控和版本联动不普遍。
    9. 因果评估、真实世界研究、药物警戒式线上安全监控:A/B 有,因果推断和长期安全信号少。
    10. 责任链、审计、模型卡/数据卡标准化:大厂有,行业不统一。
    11. 关键路径形式化验证:几乎只在金融、航天等少数领域。

    6. 后续优先级:先压尾部风险,再提上限

    按“先压尾部风险,再提上限”的顺序,建议如下。

    P0,立刻做

    1. 版本化政策包 + eval 门禁
      所有 prompt、工具 schema、安全策略、知识库、模型版本全部版本化;变更必须过离线 eval、红队、回归测试,可灰度、可回滚。
      对应中医“经典先验 + 药典 + 版本注疏”。
    2. 风险分层路由 + 硬约束
      先判风险等级和领域,再选模型、提示、工具、流程。关键动作用传统代码、规则引擎、约束解码兜底。
      对应“辨证纲领 + 方证相应 + 禁忌”。
    3. 工具沙箱 + 审批 + 回滚
      最小权限、dry-run、事务、幂等、超时、最大步数、kill switch;高风险动作转人工。
      对应“十八反 + 复诊 + 中病即止”。

    P1,紧接着做

    1. 多源证据权威分级 + 冲突仲裁 + 置信度校准
      来源分级、时效加权、强制引用、投票/仲裁、校准。
      对应“四诊合参”。
    2. OOD 检测 + 拒答转人工 + 在线监控
      低置信、分布外、高风险、超能力时转人工;监控告警。
      对应“六不治 + 复诊”。
    3. 案例回流 + 定期更新
      失败案例入 eval 集,专家标注,更新 few-shot、RAG、微调。
      对应“师承 + 医案”。

    P2,中期做

    1. 多模型集成/辩论/仲裁用于高风险。对应“会诊”。
    2. 数据漂移与嵌入模型版本监控。对应“道地药材 + 炮制”。
    3. 审计责任链、模型卡、数据卡、合规。对应“药典 + 行医资格”。
    4. 关键路径形式化验证、因果评估、真实世界研究。对应“现代补强”。

    如果只做五件事

    1. 版本化 + eval 门禁;
    2. 风险路由 + 硬规则;
    3. 工具沙箱 + 审批 + 回滚;
    4. 证据分级 + 冲突仲裁 + 校准;
    5. OOD 拒答 + 转人工 + 案例回流。

    这五个,正好对应中医的“经典先验、辨证、方证、禁忌、四诊合参、六不治、复诊”。


    7. 结语

    AI Harness 不能让模型变确定,但可以把概率泛化的方差和尾部风险压到可接受范围。

    中医的经验工程,是一套前现代版本的概率系统治理:

    强先验、分型路由、多证据、硬禁忌、反馈复诊、师承集成、数据治理、制度护栏。

    AI Harness 最该学的,不是玄学化中医,而是把这套思路转译成现代工程语言:

    确定性外壳 + 概率内核 + 反馈闭环 + 治理审计。

    传统软件像按图纸运行的机器;现代 AI 像训练出来的专家系统。
    而 AI Harness 的任务,就是让这个概率性专家系统在真实世界里:
    少犯大错,可被监控,可被纠正,可被追责,可被回滚。

    📚参考链接

    Why The Harness Matters More Than The Model | YC Paper Club

  • 相关阅读:
    Rust中的闭包
    SpringBoot2.0---------------6、SpringBoot开发小技巧
    22-08-02 西安 尚医通(02)Vscode、ES6、nodejs、npm、Bable转码器、js模块化、webpack
    【软考】6.1 信息安全及技术
    mybatisplus多条件对象xml分页查询
    王爽《汇编语言》检测点11.2详细解析
    国际经济合作名词解释
    Linux系统之watch命令的基本使用
    Github 星标 57.9K!阿里巴巴 Java 面试突击汇总(全彩版)首次公开
    在spring boot+vue项目中@CrossOrigin 配置了允许跨域但是依然报错跨域,解决跨域请求的一次残酷经历
  • 原文地址:https://www.cnblogs.com/east4ming/p/22979442