把AI Agent从屏幕带向真实设备
北京时间2026年8月28日,Anthropic 官方英文 X 账号发布了一条关于 Model Hardware Standard(MHS)的帖子,宣布启动这一新标准的首阶段研究预览。公开索引快照显示,该帖在发布约半天后已经达到百万级浏览并获得数千次点赞,成为过去24小时内 Anthropic 相关英文内容中传播最广的一批。与一般模型更新不同,这次发布没有把重点放在聊天、写代码或网页操作,而是直接瞄准显微镜、液体处理设备、机械臂、量子计算激光系统等真实硬件。
MHS 的目标,是给 AI Agent 和可编程设备之间建立一套通用接口。过去一个实验室或制造现场若想把不同厂商的设备连在一起,往往需要工程师逐台研究接口、编写驱动和“胶水代码”,整个集成过程可能耗费数周甚至数月。Anthropic 表示,MHS 希望把这类工作压缩到数小时或数分钟,并让 AI 能够发现设备、理解设备能力、读取状态、下发操作,同时按照预先定义的安全限制运行。
MHS更像“AI连接硬件的通用插口”,而不是一套新的机器人
从技术思路看,MHS 并不是让 Claude 凭空获得机械能力,也不是 Anthropic 自己制造了一套机器人。它更接近一个标准化的软件层:设备通过统一驱动暴露基本能力,例如读取温度、设置参数、移动机械臂或启动某项流程;AI Agent 则通过 MCP、命令行或 API 调用这些能力。MHS 还可以把设备重量、可调范围、危险动作和其他过去写在手册里的信息,用结构化方式提供给模型。
这一设计与 Anthropic 此前推出的 Model Context Protocol(MCP)有明显延续关系。MCP 解决的是 AI 如何连接软件、数据库和工具,MHS 则进一步把同样的思路推进到实体设备。值得注意的是,Anthropic 表示 MHS 本身与模型无关,只要设备具备可编程接口,理论上并不限于 Claude,也可以被其他 Agent 框架调用。Anthropic 目前只开放研究预览,并计划在与科研、机器人、电子和制造伙伴完成更多安全评估后再开源,因此现在还不能把它视为已经成熟普及的行业标准。
最吸引眼球的案例来自量子计算:58%提升到99.3%
Anthropic 在官方材料中披露的早期实验,为 MHS 的潜力提供了一个非常直观的例子。量子计算公司 QuEra 使用 MHS,让 AI Agent 接入其量子计算机中的激光系统。对中性原子量子计算而言,激光频率需要保持极高精度,一旦受到温度、振动或气压变化影响而失去锁定,整个量子操作就可能受到干扰。
QuEra 过去曾由激光工程师、软件工程师、算法人员和测试人员花费数月开发一套自动恢复脚本,但这套线性脚本的成功率约为58%,单次尝试约需150秒。接入 MHS 后,Claude 在夜间反复提出假设、修改脚本、执行真实测试并读取结果,最终形成了一套确定性控制程序。在后续700次盲测中,该程序成功恢复695次,成功率达到99.3%。最复杂的情况需要约10至14秒,而较简单的情况只需不到数秒。
这里有一个容易被忽略的细节:最终上线的并不是“让大模型永远实时操控激光”,而是 Claude 在实验阶段通过真实硬件反复探索,最后把学到的策略固化成可检查、可重复执行的确定性代码。这种“AI先探索,传统程序再执行”的模式,可能比让生成式模型永久处在关键控制回路中更容易获得实验室和工业环境的接受。
在生物医药实验室,AI开始参与真正的闭环实验
另一个早期案例来自 Genentech。研究人员使用 MHS 把移液设备、机械臂和微孔板读取仪连接起来,让 Claude 参与 BCA 蛋白定量实验。模型不只是照着固定流程运行,而是能够根据实验读数调整液体传输速度。面对普通水和更黏稠的蛋白样品时,Claude 通过多轮试验寻找不同流速,并在部分设备错误出现后尝试自动恢复。
不过,这个案例也暴露了当前 AI 操作真实世界的局限。例如,液体产生气泡时,Claude 一开始倾向于重复尝试,却没有自然理解“继续搅动只会制造更多气泡”这一物理后果,最终仍需要研究人员解释原因并把经验写进后续操作规则。这说明语言模型即使在软件推理上表现很强,对物理、化学和生物约束的理解仍可能存在明显断层。
Carnegie Mellon University 的另一项实验也显示了这种模式的价值。研究人员用 MHS 连接原本接口完全不同的液体处理设备、板式读数仪、机械臂和监控摄像头,并让 Claude Opus 4.8 自动执行剂量反应曲线实验。官方材料称,原本由供应商搭建可能需要数周的集成工作,在该实验中约八小时就完成;整个实验速度大约提高到原来的三倍。
真正重要的变化,是AI开始进入“读写现实世界”的阶段
过去两年,AI Agent 的主战场主要在数字世界:读邮件、查网页、写代码、调用数据库、操作浏览器。MHS 指向的下一阶段则是“物理 Agent”。当模型可以读取真实传感器、控制设备并根据结果继续行动时,AI 的输入和输出不再只是文字与文件,而是温度、光学信号、机械运动、实验样本和机器状态。

这对科研尤其有吸引力。今天很多实验的瓶颈并不是缺乏想法,而是设备之间无法互通、自动化成本过高、夜间无人值守,以及大量实验参数需要反复人工调试。如果 AI 能够把论文分析、实验设计、设备控制、数据读取和下一轮决策连接起来,科学研究就可能形成更完整的“设计—执行—观察—修正”闭环。
制造业也存在类似机会。不同品牌机械臂、检测仪器和生产设备往往拥有各自的软件接口,而统一的机器可读标准可以降低跨设备编排的成本。如果 MHS 或类似标准最终得到硬件厂商支持,新设备甚至可能在出厂时就带有能被 Agent 识别的能力描述和安全限制,就像今天的计算机外设通过标准驱动被操作系统发现一样。
但把AI接到机械臂和实验仪器,风险也从“答错”升级为“做错”
这也是 MHS 与普通聊天机器人最大的区别。在文字世界里,一次错误回答通常意味着信息质量下降;在物理世界中,一次错误动作可能损坏昂贵仪器、浪费实验样品,严重时甚至可能造成人身风险。WIRED 在报道中指出,AI Agent 进入真实设备后,如何防止误操作和恶意使用会成为核心问题。
Anthropic 因此强调,MHS 会把硬件限制、安全边界和设备属性直接暴露给 Agent,并计划在正式开源前与合作伙伴建立更多安全评估。官方案例也显示,Claude 在某些它认为存在风险的操作前会主动等待人工确认。这种谨慎会降低自动化程度,却可能是科研和工业环境真正部署 AI 时必须付出的代价。
MHS接下来最值得观察的四个问题
- 第一,Anthropic 何时真正开源 MHS,以及硬件厂商是否愿意把它预装进新设备,将决定它能否从研究项目变成事实标准。
- 第二,MHS 宣称与模型无关,这意味着 OpenAI、Google 或开源模型理论上也能接入;如果生态真的开放,它的价值可能远大于只服务 Claude。
- 第三,物理安全、权限管理、审计日志和紧急停止机制必须比普通软件 Agent 更严格,否则任何模型幻觉或提示注入都可能带来现实后果。
- 第四,AI 的物理常识仍然是短板。模型可以快速搜索参数空间,却未必真正理解液体、材料、机械和生物系统,因此人类专家仍会长期承担安全边界和实验判断。
结语:Anthropic正在把Agent竞争从电脑屏幕推向实验台
Anthropic 这条热门英文 X 帖子之所以值得关注,不只是因为 Claude 又多了一个新功能,而是因为它揭示了 AI Agent 的竞争正在发生边界迁移。MCP 让模型更容易连接软件,MHS 则尝试让模型连接真实机器。如果这一方向能够建立足够可靠的标准、安全机制和硬件生态,未来 AI 的角色可能从“帮科学家分析数据”进一步变成“和科学家一起运行实验”。
但这条路显然比浏览网页或执行代码更难。真实世界不会因为模型给出错误答案就自动回滚,设备故障、材料特性和人身安全都要求更严格的控制。因此,MHS 当前最值得关注的并不是它能否让 Claude 炫技式地控制机械臂,而是 Anthropic 能否证明:AI 在获得“手”和“眼睛”之后,仍然可以被约束、被审计,并在复杂物理环境中可靠工作。若这一点成立,MHS 才可能成为连接下一代 AI Agent 与现实世界的重要基础设施。
