AI最新动态|2026-08-03

本期汇总了12 位 AI 建造者的 26 条动态、1 期播客,提炼值得关注的产品进展、工程实践与行业变化。

12 位作者26 条动态1 期播客0 篇博客

本期速览

  • Vercel CEO Guillermo Rauch 宣布其内部运营已全面由自研 agent @v 驱动,并称“AI 代理运行整个公司”的趋势可以从此推演。
  • Core Automation 创始人 Jerry Tworek 在播客中提出“架构是当前瓶颈”的论点,认为 Transformer 已到需要被重新审视的阶段。
  • Dan Shipper 提出“代理性断裂”三阶段模型,解释人类在 AI 接管任务后的心理适应过程。
  • Amjad Masad 的 LLM 国际象棋引擎已在 LiChess 上自主对战真人,当前 Elo 1253。
  • Aaron Levie 指出一个反直觉趋势:数学、代码等“最难”的工作反而最先被自动化,因为其结果可验证。

X 上的关键观点

代理架构与组织形态

Guillermo Rauch 详细阐述了 Vercel 内部代理的演进逻辑:团队曾构建数十个独立代理,但用户体验糟糕——“就像每个代理都有自己的域名”。最终他们收敛到单一代理 @v,它同时充当“代理和路由器”,拥有子代理、技能,并能通过网络将任务委托给其他代理。Rauch 用互联网路由的演化做类比:从混乱的独立节点走向统一的入口,必要时再通过“子域名”方式暴露特定代理。他强调,自建代理与使用第三方 Slack 集成的本质区别在于控制权:“那不是你的代理,是他们的代理。”

自动化顺序的悖论

Aaron Levie 提出了一个值得注意的观察:部分“最难”的工作反而会最先被自动化,关键在于可验证性。数学、网络安全和代码虽然难度极高,但结果可以被客观测试,这带来双重好处——训练时奖励信号更清晰,运行时可以规模化验证正确性。相比之下,法律条款、营销策略、销售话术等领域没有唯一正确答案,依赖操作者的判断和风险偏好,且正确与否往往要很久之后才能知晓。他的结论是:即使模型能力持续指数级增长,应用层仍有大量工作要做,流程本身也需要随时间调整。

代理性断裂

Dan Shipper 描述了人类面对 AI 能力替代时的心理过程,他称之为“代理性断裂”,并归纳为三个阶段:最初只看到 AI 完成任务,人类支撑工作不可见(如“AI 解决了某数学问题”的说法);随后开始看到人类在两端搭建的脚手架,产生“AI 在提示我”或“我的工作就是 babysit Claude”的感觉;最终在足够长时间后重建新的代理感。他还提出了一个哲学推论:如果“应当”蕴含“能够”,而技术重塑人类能力边界,那么 AI 也必然同时改变我们的道德直觉。

数学领域的杰文斯悖论

Thariq 观察到数学领域正在出现杰文斯悖论:AI 让数学活动更活跃、更易理解,数学家得以在更高抽象层次与公众交流,因此对数学思考者和专家的需求反而上升。他同时指出这与国际象棋的历史有诸多相似之处。

投资市场的“氛围资本”

Nikunj Kothari 从投资人视角描述了当前市场的分裂状态:早期和中期 VC 已完全变成“氛围资本”,与基本面脱节;同时万亿市值公司的股价也能因模型发布等事件出现超过 5% 的日波动。他认为这种状态至少还会持续 12 到 18 个月。

其他值得注意的帖子

  • Karpathy 分享了 Simon Willison 的“自行车上的鹈鹕”测试,并上传了可在浏览器中运行的源码。
  • Swyx 记录了 Codex 处理客服对话的案例:机器人不仅完成了升级请求,还附上了完整证据反驳客服的推诿。
  • Peter Steinberger 报告了一种新型垃圾信息,但未提供细节。
  • Garry Tan 评论称“惊奇感消失的时刻,恰恰是惊奇度走向抛物线的时刻”。

播客精华

Core Automation:架构是瓶颈

在 Training Data 播客中,Core Automation 联合创始人 Jerry Tworek 和 Rohan Anil 讨论了前沿研究现状。Tworek 的核心论点如下:

Transformer 在过去六年被大规模扩展,但本质上只重复了两种操作:MoE 和注意力。当前瓶颈不在数据或算力,而在架构本身。他回顾了自己在 OpenAI 的经历:当 RL 规模化终于到来时,模型在基准测试上持续进步,却并未解决真实世界任务。原因在于训练分布与真实世界分布存在根本差异。

他提出,未来需要能在测试时学习的模型——在用户数据上、在真实分布上学习。现有两种测试时学习方式都有缺陷:上下文学习数据效率高、无灾难性遗忘,但容量有限(他提到使用 Codex 约 20 分钟后就需要压缩上下文);而持续微调则面临灾难性遗忘和数据效率低的问题。因此需要一种能在架构层面表达“学习如何学习”的算法,支持更长时间跨度的适应。

Tworek 还区分了两种学习模式:足球训练类似强化学习,通过大量试错调整;而学习数学则是深度思考直到概念连通。两者都是经验学习,但机制不同,RL 并非经验学习的终点。

值得继续关注

  • Vercel 的 @v 代理模式是否会成为企业代理部署的主流范式,其“单一入口 + 子代理委托”架构值得跟踪。
  • Core Automation 对 Transformer 替代方案的探索——如果架构确为瓶颈,新架构的进展将直接影响前沿模型能力上限。
  • Amjad Masad 的 LLM 国际象棋引擎在 LiChess 上的 Elo 走势,可作为 LLM 在规则明确环境中能力的持续观测指标。
  • Dan Shipper 的“代理性断裂”框架是否会被更广泛引用,成为讨论人机协作心理影响的常用语汇。

原始来源

X / Twitter

播客

本文由自动化流程根据公开信息生成中文摘要,观点与事实请以原始来源为准。