AI最新动态|2026-09-22

本期汇总了10 位 AI 建造者的 21 条动态、1 篇官方博客,提炼值得关注的产品进展、工程实践与行业变化。

10 位作者21 条动态0 期播客1 篇博客

本期速览

今天的讨论集中在三件事上:个人智能体开始接管真实交易与日常操作,浏览器与编码智能体的能力边界继续外扩,以及围绕提示注入的安全攻防被推到产品化前台。Anthropic 的 Claude in Chrome 正式开放,是唯一一条官方博客更新,也把“智能体自主操作浏览器”从试点变成默认能力。

X 上的关键观点

智能体商业化的想象空间被反复提起。 Aaron Levie 认为,个人智能体代用户完成交易,会带来可观的变现潜力:用户会从处理琐碎任务开始,逐渐把更复杂的任务交给智能体,最终通过智能体产生的支出可能超过以往。他同时强调,智能体使用软件的频率将是人类的百倍,CRM、ERP、数据平台这类“核心原语”反而更重要,因为它们要承担安全层、护栏、数据管理和业务逻辑编排的角色。这是他的判断,不是已发生的事实。

广告模式的隐忧。 Peter Yang 提出一个值得警惕的问题:如果大量业务依赖向人类投放定向展示广告,而智能体直接浏览网站、完成任务、人类根本没看到广告,广告市场会怎样?这是他的推测性担忧,尚无数据支撑。

编码与浏览器智能体的实战反馈。 Guillermo Rauch 称 Grok 4.7 漂亮地解决了一个逆向工程运行中二进制的难题,且速度很快;他还提到 AI Gateway 现在支持通过 HTTP 使用 Jev。Garry Tan 则称 Capy 能跟踪多步工作流,做大型 PR 比单独使用 Codex 或 Claude Code 更快,并给出一个在 GBrain 上并行修复 bug 的 PR 示例。Nikunj Kothari 表示自己长期以 Codex 为主要智能体,认为 Mac 上的 Codex 在 Computer Use 方面“无可匹敌”,同时称赞 Instinct 和 Muse 在手机浏览器场景下零配置、适合大众。这些均为个人使用体验,带有主观色彩。

对“堆 token”的反思。 Nikunj Kothari 提出,多数鼓吹 tokenmaxxing 的公司产品体验最差,好产品靠的是策展与园艺,而非把一切丢给智能体。这是一个值得记下的反向观点。

其他零散信号。 Thibault Sottiaux 预告“周二重置”,语气高调但未透露细节。Amjad Masad 称 AI 正在复兴美国梦。Peter Steinberger 澄清“Meta 使用 OpenClaw”的传闻,称对方是受启发自建智能体,并强调自托管 claw 的好处是“他们封不了你”。Thariq 则调侃自己一天要多次输入“用大图、少文字”。

官方博客更新

Anthropic 宣布 Claude in Chrome 在全部付费 Claude 套餐中正式可用。关键变化是:Claude 现在可以在浏览器中自主执行操作,不再需要每一步都获得批准;一个安全分类器会在动作执行前校验其是否安全、是否符合用户请求。官方称,该能力可覆盖内部仪表盘、遗留系统、供应商门户等未接入 Claude 的工具,能读取页面、输入文字、点击链接、跳转页面、填写表单,并使用用户已有登录态。

安全方面,官方重点回应了提示注入。博客称已改进模型训练与探针,并新增一组分类器。其评估数据显示:在更强红队攻击下,未加额外防护时攻击对 Opus 4.5 的成功率为 17.6%,对 Opus 5 为 3.8%;在探针加安全分类器后,对 Sonnet 5、Opus 5、Mythos 5 的攻击成功率为 0,对 Fable 5 为 0.3%。官方也承认提示注入是“移动靶”,需持续投入。需注意,这些数字来自 Anthropic 自评估,应视为厂商数据。

值得继续关注

第一,Sottiaux 预告的“周二重置”具体内容尚未公布,若涉及产品发布,值得跟进。第二,Claude in Chrome 的自主操作与安全分类器在真实网页环境中的表现,尤其是提示注入防护是否经得起外部复现。第三,智能体代交易若成规模,广告与电商的商业模式会如何调整,目前只有观点、没有数据。第四,Capy、Codex、Grok 等编码智能体的对比仍停留在个人体验层面,缺少可比的基准结果。

原始来源

X / Twitter

官方博客

本文由自动化流程根据公开信息生成中文摘要,观点与事实请以原始来源为准。