EXPERT ESSAY · 专家思考
互联网给模型知识,现实给模型经验
Clinical Reality Access,可能是 AGI 下一层被低估的基础设施
01一个在错误世界里自洽的模型
先说一个我们项目里真实发生过的事故。
我们曾用一个成熟的器官分割模型,为一批 CT 体数据自动生成解剖标签。模型本身没有任何异常表现:肝、脾、肾、肺,该分的都分出来了,边缘干净,形态合理,视觉上甚至称得上漂亮。任何一个只做抽查的人,都会认为这条管线运转正常。
后来我们发现,输入数据的一个空间轴被镜像了。
这件事真正让人后背发凉的地方,不是数据出了错——做医院数据的人都知道,数据出错是常态——而是模型没有因此崩溃。它依凭自己的解剖先验,在一个镜像后的世界里继续工作,分割结果内部完全自洽,只是患者的左右已经错了。等我们用真实的解剖约束重新审计时,问题已经扩散开,最终有 17,143 个序列需要重新处理,并且要为整个系统重建方向校验规则。
我后来反复回想这件事,因为它和今天大模型身上最令人着迷、也最令人不安的特性,在结构上是同一个:一个足够强的模型,可以在错误的现实坐标系里,给出高度自洽的答案。
模型拥有庞大的世界知识,能够建立连贯的解释,能够在上下文里自行补全缺失的信息。但连贯不等于真实。只要它接触现实的接口是错的,它完全可能在一个错误的世界里,表现得越来越聪明。
这是我开始使用 Reality Access 这个词的原因。
02互联网解决的是知识,不是经验
大模型的奇迹,很大程度上来自人类第一次把如此大规模的语言化知识,压进了同一个参数空间。论文、教材、代码、网页、问答、新闻——凡是已经被语言化、数字化、公开化的东西,都在迅速变成模型可以吸收的公共资源。“知道什么”正在变得很便宜。
但经验不是知识的另一种写法。
经验来自这样一种过程:你做出一个判断,世界继续运行,几小时、几个月甚至几年之后,现实回来告诉你,当时对了,或者错了。一个影像医生看到胰腺的异常,判断高度疑似胰腺癌——真正有价值的反馈,不是另一位医生也说“像癌”,而是六个月之后,手术病理证明它不是癌。那一刻发生的不是数据库里多了一条标签,而是一个完整的认知闭环:当时看到了什么,为什么形成那个判断,采取了什么行动,最后实际发生了什么,错误究竟出在哪个环节。
这类东西,绝大多数从未进入互联网。甚至在医院内部,它们也常常没有被结构化地记录下来。它们存在于医生的记忆里、科室的口口相传里、以及大量随时间流失的上下文里。
所以有一句话我越来越相信:模型可以学习互联网,但无法学习那些从未被记录的现实。
03Reality Access 不是“接一个 API”
很多人第一次听到 Reality Access,会把它理解成 Agent 接入了 HIS、PACS、ERP 或者数据库。这只是最表面的一层。一个 Agent 能打开某个系统,并不等于它理解了这个系统所代表的现实。
在真实的医院里,我们反复遇到这样的事情:DICOM 标签会错,RIS 字段会空,检查部位会张冠李戴,设备厂商用完全不同的命名方式表达同一种序列;数据库里一个看似正常的身份字段,可能因为历史上的占位值,把成千上万条记录错误地串在一起。系统里“有数据”,和 AI 获得了“现实”,中间隔着很远的距离。
按深度排列,Reality Access 至少有五层。最浅的一层是现实的可流通衍生物——规则、小模型、知识图谱、质量控制器,它们已经把一部分现实经验压缩成了机器可以直接调用的结构。往下是历史数据,它比公开知识更接近现实,但仍然是过去留下的静态切片。再往下是私域系统接口,Agent 能够读取和操作医院、企业、实验室内部的真实系统。第四层是实时工作流,它开始看到人真正怎么做事:什么时候查看结果,什么时候忽略,什么时候修改,什么时候人工接管。最深的一层是长期现实结果——病理、治疗反应、手术结局、复发,以及数月之后才能知道的最终事实。
越往下,越难复制,也越接近真正意义上的“经验”。
04医疗是 Reality Access 的困难模式
为什么我认为医疗值得被做通用智能的人认真关注?不是因为医疗崇高,也不只是因为医疗容错率低,而是因为医疗把 Reality Access 的困难放大到了极致。
在软件世界里,一个 Agent 操作错了可以回滚,一个强化学习环境可以重置,一段代码跑错了可以重新执行,一个游戏环境可以无限重放。但患者不是模拟器。你不能把一个患者恢复到六个月前,让疾病的自然史重新走一遍。病理结果、治疗反应、复发和死亡,都属于一种无法廉价重置的现实——世界必须真的运行一次,我们才能知道结果。
这意味着医疗领域最宝贵的数据,往往不是“图像—标签”这样的静态配对,而是一条完整的链条:状态、判断、行动、结果,以及事后的错误归因。如果 AGI 真的要从“会回答问题”变成“能够在世界中行动并学习”,那么这种不可重置、低频、昂贵、延迟的反馈,恐怕比互联网语料更接近它最终必须解决的问题。
05最重要的基础设施,一直由人肉维持
这里存在一个行业里心照不宣的盲区。
医疗 AI 的讨论里,大家愿意谈模型、算力、标注量、AUC、多中心、长随访。但真正把一个项目从原始医院数据变成可训练数据集的人,通常是谁?是研究生、实习生、年轻医生、科研助理和信息科工程师。他们做的是大量不体面的工作:查 HIS、核对检查日期、修乱码、下载影像、排除没有像素的序列、判断哪个序列真的属于这个部位、核对病理、寻找漏掉的随访、修正错误标签、处理同一患者在不同系统里的身份映射。
这些劳动对论文至关重要,却很少进入实验室的成本模型,因为研究生的时间接近于免费。于是整个行业形成了一种认知幻觉:数据仿佛天然就在那里,真正昂贵的只有模型。如果把这些工作全部按市场价格计算,相当多医学 AI 项目的成本结构会立刻倒过来。
而这个倒挂正在加剧。当 Coding Agent 把写代码从三个月压缩到三小时,研究生花三个月清洗数据就不再是一件可以忽略的小事。AI 越强,过去被人肉默默吸收掉的那层“现实胶水”,反而越容易成为最后的瓶颈。
06真正值钱的不是踩过坑,而是把坑压缩成了智能
我们曾让本地的 Agent 从六个医学影像项目的历史记录里,专门抽取那些“只有处理过真实医院数据才会知道”的经验。得到的不是一套漂亮的知识库,而是一堆现实留下的伤疤。
举几个例子。
一个报告质控模型,在标准测试集上 F1 达到 0.929,看起来已经相当不错。但把它放进 1000 份真实报告的完整生产管线里跑,最后只命中 1 条真正有价值的错误。这次失败改变了我们对测试集的理解:真实上线的验收,必须与前置规则、真实的低先验分布和人工审核一起进行。Benchmark 本身不再拥有最终解释权。
再比如,一个数据库身份字段里的占位脏值,曾把 24,175 个姓名关联到同一个值上。如果直接相信数据库字段,就会产生大规模的跨患者污染。还有一次,旧规则为了避免漏匹配,把已经被大模型拒绝的病理候选重新“兜底”接纳,最终制造出 18,232 条错误的病理关联。又比如,我们曾把 DERIVED 理解为“衍生影像,可以过滤”——这在 CT 和 MR 里通常合理,但在某些数字 X 光设备上,正式诊断图像本身就是 DERIVED,一个看起来十分通用的规则,最终让这类设备的生产任务失败率达到 85%。
这些故事看起来像工程 bug。但如果只把它们当 bug,就浪费了最重要的东西。每一次真实事故,都可以被压缩成一种可重复使用的资产:一条规则、一项约束、一个小模型、一个 failure detector、一套 review policy,或者一个以后再也不能被轻易跨越的测试用例。
我把这类资产叫作现实衍生智能。它和通用模型的区别在于:模型主要从人类已经表达出来的知识中学习,而现实衍生智能来自一个系统在真实世界里真的失败过、被人理解过、并且把教训编码了下来。
07更强的大模型,不会自动吞掉胶水层
一种很自然的想法是:模型再强一点,这些规则和小模型不就都不需要了吗?这个判断忽略了两个问题。
第一个是训练数据从哪里来。一家通用模型公司可以拥有更多互联网文本、更强的算力、更好的强化学习,但它没有自然的途径知道,某家医院的检查部位字段在什么情况下会撒谎,也不知道某类扫描协议为什么经常被技师借去扫描另一个部位,更不可能凭借公开语料获得某个患者半年后的真实临床结局。
第二个是计算经济性。即使一个万亿参数的模型有能力判断某个确定性问题,也不意味着每次都该调用它。真实系统里最合理的架构往往是分层的:稳定而高频的事情交给规则,局部关系交给知识图谱,视觉定位交给小模型,只有复杂、模糊、长尾的问题,才升级到大模型或 Agent。
未来真正强大的 Agent,很可能不是一个直接处理所有问题的万能大脑,而是一个能够调度大量经过现实验证的领域工具的认知中枢。模型负责理解模糊任务、选择工具、处理冲突、决定下一步;而那些便宜、稳定、可审计的领域智能,构成它与现实之间的感知和行动层。
08AI 行业正在从不同方向撞上同一堵墙
这个故事并不只发生在医院。
2026 年一个很值得注意的变化是,企业级 AI 开始频繁讨论 Context Layer——没有可靠的企业上下文层,Agent 很难被安全、低成本地接入真实业务。Palantir 的 Ontology 走得更远:它不只表达数据,还试图同时表达企业里的对象、逻辑、行动和权限,并把模型输出与后来的实际结果重新连接起来,形成反馈闭环。Scale AI 则把另一部分问题命名为 RL Environments:Agent 不应该只看静态问答,而需要在接近真实工作的环境里留下完整的轨迹,经历状态变化、工具调用和可验证的结果。与此同时,Forward Deployed Engineer 成了 AI 行业增长最快的岗位之一——它的存在本身就在说明,最强的通用模型进入一家真实组织之后,仍然需要有人站在模型和现实之间,理解那些没有写进任何文档的规则、脏数据和工作流。
这些变化指向同一个方向:通用智能正在变便宜,而把通用智能接到特定现实上,正在变贵。
只是今天产业界最热门的那些“现实”,大多数仍然是可以复制、可以重置的数字世界:浏览器、ERP、CRM、代码仓库。医疗把这个问题往前推了一步——Salesforce 可以重置,患者的六个月不能。这正是 Clinical Reality Access 与一般企业 Context Layer 最值得区分的地方。
09Clinical Reality Access 到底是什么
如果把它压缩成一个最简单的架构,我认为至少包含三部分。
第一部分是 Context,回答的问题是:Agent 当前面对的现实究竟是什么?在医学影像里,这意味着不能只相信一个 DICOM 字段,也不能只看单张图像,而要把像素、几何、检查意图、序列上下文、解剖覆盖、历史报告以及不确定性,组合成一个可信的临床状态。
第二部分是 Domain Intelligence,把长期积累的专业经验压缩成机器可执行的形式:规则、小模型、知识图谱、质量控制器、failure detector、经过验证的测试集。它们不是大模型的竞争对手,而是 Agent 可以调用的现实工具。
第三部分是 Feedback,回答的问题是:模型的判断进入真实世界之后,发生了什么?最浅的一层是结果有没有正确生成和送达;再往下,是医生有没有看、有没有修改、有没有驳回;更深一层,是医生为什么驳回;最深的一层,是病理、治疗反应和长期随访最终证明了什么。
于是完整的闭环变成:现实被组装成上下文,上下文驱动领域智能和 Agent 的行动,行动引发人或世界的回应,回应沉淀为结果,结果被归因,归因反过来更新整个系统。这不再是一次推理,而是一套能够积累经验的基础设施。
10真正稀缺的,可能不是最强的模型
基础模型会继续变强,通用技能会继续商品化,代码会越来越便宜,甚至训练一个小模型本身也会越来越容易。在这样的趋势里,真正难以复制的东西会变成:持续接触某种真实世界,并且持续知道模型在哪里错。
这会带来一种新的资产结构。医院不能把患者原始数据随意拿出去,工厂不会公开全部生产日志,公司不会把内部业务全部放到互联网上。但这些不可流通的现实,可以经过长期工作被压缩成规则、模型、知识图谱、模拟器、测试集和专业工具。原始的现实不一定能交易,但它的合法衍生物可以。交易的不再只是提示词或 API,而是经过真实世界反复验证的专业判断能力。
一个影像序列识别器、一套覆盖范围规则、一个数据异常检测器,看起来都只是很小的工具。但如果它们背后拥有持续的真实反馈、错误归因和更新闭环,它们就可能成为 Agent 必须经过的关口。这与传统 SaaS 的逻辑不同——它更像是把不可流通的现实经验,压缩成可以重复调用的智能资产。
11现实如何被压缩成经验
回到最初那个问题。我们也许正在接近一个转折点:过去,智能的主要瓶颈是模型内部有没有足够复杂的表征和推理能力;而随着模型越来越强,一个新的问题变得越来越显眼——模型如何获得不在训练集里的世界?
Coding Agent 之所以进步得快,一个重要原因是它生活在一个极其友好的世界里:编译器会告诉它错在哪里,单元测试会给出即时的奖励,运行错误会把失败直接暴露出来,整个环境可以不断重置和重放。现实世界不是这样。医生的判断可能半年后才知道错,实验材料可能两周后才出结果,一个市场策略可能要跨越完整的经济周期才能验证。
如果 AGI 最终意味着能够在开放世界里持续形成判断、采取行动、接受反馈并更新自己,那么它真正缺少的可能不只是更大的上下文窗口,而是一个足够丰富的经验通道。从这个意义上说,医学不是 AGI 的一个垂直应用,它更像一个极端实验场:这里有私有数据、模糊语义、长尾异常、不可逆的行动、昂贵的反馈、漫长的结果周期,以及大量从未被记录的默会知识。一种 Agent 架构如果能在这样的环境里稳定地形成经验,它学到的东西大概率不会只属于医学。
所以我越来越不愿意把自己的工作描述成“做几个医学 AI 模型”。那些模型当然有价值,但它们只是表层产物。真正持续积累的,是另一套东西:一家真实的医院怎样产生数据,哪些字段能信、哪些不能;哪些异常只有像素能证明;什么该交给规则,什么适合小模型,什么必须由大模型裁决;模型上线以后医生如何反应;一个当初看起来合理的判断,后来为什么被现实推翻。把这些东西逐步编码下来,得到的不是一份越来越大的静态数据库,而是一层连接通用智能与真实临床世界的基础设施。
我把它叫作 Clinical Reality Access。它的目标很简单:让 Medical Agent 不只是拥有医学知识,也能够逐渐获得医学经验。
而如果这个方向最终成立,它指向的也许不只是医疗。因为任何真正进入现实世界的 AGI,迟早都要回答同一个问题:你从哪里知道现实是什么?你做完一件事以后,谁来告诉你究竟发生了什么?那些只有世界真的运行一次才能得到的反馈,又由谁保存、解释,并转化成下一次更好的判断?
互联网给予模型知识,真实世界给予模型经验。如果大模型正在解决“知识如何被压缩成智能”,那么下一轮真正值得探索的问题也许是:现实如何被压缩成经验。