导览计划 第 26 辑
本计划共包含 8 个模块。浏览各模块时将自动记录进度,无后续考核。
模块 01OP-2609/01
评述一条流传甚广的算力开销言论及其附带的结果。
当 OpenAI 宣布解决了纳维-斯托克斯千禧年大奖难题时,我看到的大部分讨论都在说花了大约两千两百万美元的算力去赢一个一百万美元的奖金。确实,这个对比挺搞笑的。但我更好奇这活儿到底是怎么干成的。
据报道,大约一万个协同工作的 agent 搞出了一个证明和一套 Lean 形式化表示。OpenAI 放弃了奖金。达到这种水平的机器验证证明,哪怕还没人找到实际用途,本身就已经是项重大的研究成果了。
其声称的结果是有限时间奇点:光滑解可能会崩溃。这并不能给我们带来造火箭或对湍流建模的新方法。我想弄明白的是,这些 agent 究竟是如何推导数学的,以及这个过程有多少能迁移到其他问题上。
模块 02OP-2609/02
审视关于通用智能的两份公开声明,以及各自所依赖的定义。
9 月 6 日,Jensen Huang 宣布 AGI 已经到来,并归功于在超过 10 万张 Nvidia Grace Blackwell GPU 上训练的 GPT-6 Astra。两天后,那份证明发布了。早在 3 月份,他在和 Lex Fridman 讨论 AI 是否能创立并运营一家市值十亿美元的公司时,就说过“我认为我们已经实现了 AGI”。到了 8 月的财报电话会上,说法又收敛了一些:对于许多任务来说,我们可以说已经实现了 AGI。
Sam Altman 的表态也很难自圆其说:一方面说当前系统符合 OpenAI 的定义,另一方面又说他仍然期待今年晚些时候会出现一个他个人愿意称之为 AGI 的内部系统。
我觉得这让人心累。有人看了这些头条新闻,让 app 去干自己的工作,结果眼睁睁看着它在一个合格同事都能处理的事情上翻车。采访里随便挑的一个定义,并不能帮大家搞清楚这系统到底能干什么。
话说回来,Huang 把 AGI 归功于自家的十万张 GPU,确实挺逗的。
模块 03OP-2609/03
描述对该领域关注度下降的现象,并将其归因于长期的信息轰炸。
产品发布、广告、LinkedIn 动态、新闻播报,以及我一直在用但突然冒出个闪烁小图标的工具里,全都有 AI。这玩意儿真他妈无处不在。我依然想看相关内容,但我那些非科技圈的朋友往往在话题刚开头就想赶紧打住。
这有点像那种拉帮结派站队的倾向:要么一切都是泡沫,要么全都是垃圾产物,要么我们马上就要造出神了。但我那些学商科或在其他行业工作的朋友,我从他们身上看到的主要是疲惫。他们听过了太多吹嘘,不想再去评估又一个新花样了。
这是我对身边人的观察。我自己倒不太有这种感觉;我通常停下来不看只是因为身体累了。所以我觉得自己没资格对他们指手画脚,让他们多关注关注。
模块 04OP-2609/04
区分创造新能力的机构与转售能力的机构。
我看待这件事的角度大致类似于 Thiel 的“从 0 到 1”框架:有些公司在做以前不可能做到的东西,而有些公司只是在倒卖现有成品的访问权限。
转售有用的东西无可厚非。让我烦躁的是,给一个 prompt 套层壳做成订阅制,就把它当成技术突破来营销。这种吹风看多了,让人很难再去认真对待下一条宣发。
我更担心的是那些好用却有害的产品:比如监控工具,或者在宣传手册里只大谈民用用途的军事应用。在这一点上,我反对的是人们在造什么,以及谁有权使用它。
模块 05OP-2609/05
概述具身智能领域近期的融资动向及相关报道。
机器人是我希望多听到一些消息的领域。
由 Yann LeCun 担任董事长的 AMI Labs 在种子轮融资中筹集了 10.3 亿美元,致力于使用 JEPA 方法构建世界模型。Generalist AI 6 月融资 4 亿美元,据报道 8 月还在讨论 30 亿美元的估值。其 GEN-1.5 模型展示了仅通过单次演示就能学会一项物理任务,无需梯度更新或微调。
这些公司显然不缺资金。然而,相比于下一代语言模型的发布,我听到的关于他们工作的消息要少得多。这可能在一定程度上反映了我个人的关注范围。对我来说,评估机器人技术更难,而且哪怕只跟进这个领域的一个分支都要花不少时间。
如果机器人变得容易教得多,我想知道我们将如何应对体力劳动的变革。某些工作是否应该继续留给人类,包括心理咨询、医疗或特定的手艺行当?我还没有得出明确的答案。这个问题不仅关乎机器能否胜任,还涉及收入、责任,以及人们对提供服务的人本身有着怎样的期待。
模块 06OP-2609/06
汇总网络自动化流量及机器在对话测试中表现的最新数据。
Imperva 的 2026 年报告显示,在其监测的网络流量中,自动化流量占比超过 53%,其中恶意 bot 占总量的 40%,且由 AI 驱动的 bot 攻击同比增长了 12.5 倍。这些只是流量数据,并不能告诉我们到底有多少比例的帖子或对话是由 AI 生成的。
另外还有证据表明生成的对话能有多逼真。在 Jones 和 Bergen 的图灵测试研究中,参与者分别与一个人和一个模型交谈五分钟,然后判断哪个是真人。使用了拟人设定提示词的 GPT-4.5 有 73% 的时间被选为人类。LLaMA-3.1 达到了 56%;而基线模型 ELIZA 和 GPT-4o 则分别为 23% 和 21%。
我有时觉得能认出哪些文字是生成的。但我可不想指望这种判断力,尤其是在我很累或者在读自己领域之外的内容时。
模块 07OP-2609/07
建议如何保持好奇心,并指明挫败感应当指向的合理对象。
我依然喜欢在不知道结果会怎样的情况下尝试新东西。做个离谱的软件去恶心一下大学教授,或者顺着一个蠢想法一直做下去看看会发生什么。这根本没必要非得搞成一家公司。
我注意到科技圈里有些很有能力的人之所以不去尝试,是因为他们事先看不到有用的产出。我不知道在每项技术上都必须表态的压力是否也是原因之一。快节奏媒体可能也起到了一定作用,不过这也只是我的猜想。
我希望能有一点空间:既对技术本身保持兴趣,又对它的营销和使用方式持有异议。我可以反感监控产品,或者反感那种屁都没说明白的 AGI 吹嘘,但同时依然渴望去理解一个新的模型或实验。
模块 08OP-2609/08
重申前述发现,并给出一项行动建议。
这些研究足够有趣,让我愿意一直读下去。而营销让这一切变得难熬,对于非科技行业的朋友来说,他们就更没有理由去忍受这些了。
我希望更多讨论能放在尝试具体的事物上,而不是整天争论 AI 整体上是好是坏。机器人就是我希望被更多讨论的话题之一。
~ A.