本体感受人工智能显示有针对性的编辑可以改善法学硕士的预测
核心要点
- 一家初创公司声称轻量级神经探针可以实时检测和抑制幻觉,而无需重新训练底层模型 如果你可以在不接触模型本身的情况下修复人工智能模型的坏习惯会怎么样?
- 该公司还声称具有跨模型传输能力,这意味着在一种架构上训练的探针可以推广到其他架构,而无需重新训练。
- 商业剧 本体感受人工智能正在开发一种名为“The Cra

一家初创公司声称轻量级神经探针可以实时检测和抑制幻觉,而无需重新训练底层模型
如果你可以在不接触模型本身的情况下修复人工智能模型的坏习惯会怎么样?由洛根·马修·纳波利塔诺 (Logan Matthew Napolitano) 创立的初创公司 Proprioceptive AI 将整个论文都押在这个前提上,开发微型神经探针,从内部监控大型语言模型,并在有问题的输出到达用户之前进行干预。
该公司的方法不像黑匣子那样对待法学硕士,而更像是心脏监护仪上的患者。小型诊断探针挖掘模型的隐藏状态,实时读取其内部动态并在推理过程中进行有针对性的修正。根据该公司报告的基准,结果是:自信错误的输出减少了 85.8%,这是一种模型完全确信错误地陈述某些错误的幻觉。
探头的实际工作原理
本体感知人工智能技术背后的核心洞察是几何的。该公司将 LLM 内部表示描述为沿着两个通道运行:一个处理预测的 1 级主通道,以及一个低维“行为”通道,该通道承载模型对自身潜在输出的自我了解。
这些探针非常小。每个包含大约 100 万个参数,并为主机模型的参数计数增加大约 0.003% 的开销。延迟在亚毫秒范围内,这意味着监控发生得足够快,用户永远不会注意到额外的计算。
据报道,这些探针在不同的模型系列(包括 LLaMA 和 Mistral)中实现了 125 倍到 1,376 倍的分离比。该分离比衡量探针区分安全和有问题的内部状态的清晰程度。该公司还声称具有跨模型传输能力,这意味着在一种架构上训练的探针可以推广到其他架构,而无需重新训练。
为什么这对于对齐很重要
本体感知人工智能的框架使基本模型保持不变。在训练或部署期间不会改变权重。干预仅在推理时发生,这意味着底层模型在探针处理行为校正时保留其完整功能集。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
该公司报告检测功效的内部基准分数在 0.96 至 0.999 AUC 之间。据报道,在干预方面,每个代币引导在门控实验设置(数学推理的标准基准)中使 GSM8K 任务提高了 70 个百分点。
商业剧
本体感受人工智能正在开发一种名为“The Cradle”的商业产品,旨在为 3B 至 32B 参数范围内的模型提供行为适应和监控。
该公司已申请了 100 多项临时专利,包括围绕库普曼算子构建的方法,这是一种借用动力系统理论的数学框架,允许使用线性技术分析非线性系统。
看什么
报告的数字令人印象深刻,但也有一个重要的警告:迄今为止披露的所有基准都是内部的。独立验证对于在研究界和潜在企业客户中建立可信度至关重要。该公司已表示与领先研究人员合作,但同行评审的结果将比公司报告的指标更重要。
还有一个问题是,这些探头如何在超出 The Cradle 当前目标的 32B 参数上限的范围内执行。来自 OpenAI、Google 和 Anthropic 的最大前沿模型的运行参数数量明显更高。本体感受人工智能识别的行为渠道在这种规模下是否仍然具有可读性和可操作性,这是一个悬而未决的问题。
