找回密码
 立即注册
查看: 559|回复: 0

35小时烧掉40亿Token,AI自主编程交白卷

[复制链接]

74

主题

33

回帖

323

积分

中级会员

积分
323
发表于 昨天 06:11 | 显示全部楼层 |阅读模式
35小时,约40亿个Token,一个被寄予厚望的"软件工厂",最终没有产出任何有价值的东西。这是开发者Armin Ronacher用GPT-6 Astra做的一次实验,结果被写进了本期Hacker News的热议清单。
他让Astra自主决策工作流程,目标是实现一个支持虚拟线程和词法作用域的Python。听起来是个标准的工程任务,但过程暴露出的问题,比结果本身更值得看。
W2P90m0Ry9m909rm.jpg

它不用补丁工具,偏爱拼字符串
实验中最扎眼的一个细节是:模型过度依赖Python脚本拼接字符串来修改C代码,而不是使用补丁工具。
这不是能力问题,是习惯问题。拼接字符串改代码,短期能跑通,长期就是维护灾难。但模型不会主动告诉你这一点,它只会继续往下写。
评论区的判断更直接:代码质量差的时候,AI修改会越来越难,进度随之停滞。AI代理需要引导,它不会主动建议重构和测试。
换句话说,模型在长任务上表现卓越,但缺乏对"烂代码"的惩罚机制。没有惩罚,就没有纠偏动力。
清单:这期HN还有哪些值得看的
除了Astra实验,本期摘要还覆盖了另外几个方向,逐条看:


  • Claude年龄验证:Anthropic将Claude限制为18岁以上用户并要求年龄验证。评论认为这是强迫用户提供政府ID的借口,以改善平台数据分析。讨论延伸到"合规胸"、芝麻过敏法规导致制造商故意添加芝麻、加州65号提案导致随意贴警告标签等案例,指向同一个现象——合规要求常产生与初衷相反的激励。
  • 声波灭火器:墨西哥一名16岁学生发明了声波灭火器,用30Hz脉冲声波在5到8秒内灭火,对木材、油类和电子设备均有效。原理是声波振动将氧气从火焰周围推开。
  • 胡塞武装与AI伪造军令:胡塞武装控制红海丕林岛,威胁曼德海峡航运。评论指出,他们利用AI克隆指挥官声音伪造撤退命令并通过Twitter传播,导致对手溃败。反对派军队缺乏正规指挥链,依赖社交媒体接收命令,易被欺骗。
  • OpenAI Agents API:OpenAI发布Agents API全栈文档,评论认为抽象仍不清晰、专有模型未必最优。
  • Waymo效应:一篇讨论"Waymo效应"的文章指出,AI消除人际摩擦的同时,削弱了科研合作中的挑战与偶然发现。文章以无人驾驶出租车类比AI对科研的影响:大语言模型像"无摩擦的同事",随时可用、不会反驳核心假设。但合作者的"不便之处"恰恰是合作的核心。评论指出该文本身疑似由LLM生成,形成讽刺。
  • 谷歌芬兰投资:谷歌在芬兰投资130亿欧元建AI基础设施,包括新建三个数据中心、扩建现有设施,并与Fortum签署22年协议购买Loviisa核电站最多50%电力。芬兰因气候凉爽、低碳电力充足和电网压力小成为数据中心热门选址。
  • 死亡射线攻击:利用WebGPU使Mac死机,苹果认为无安全影响,不修复。
  • HuggingFace的security.txt:页面调侃AI代理去GitHub获取基准测试高分。

能源才是算力的真瓶颈
谷歌那笔130亿欧元的投资里,最值得琢磨的不是数据中心数量,是那份22年的核电购买协议。
评论区的讨论方向也很一致:瑞典电力扩张困难、核反应堆关闭存在争议、南北输电容量不足导致价格差异。最后的落点是——电网瓶颈而非发电中心,才是关键约束。
芬兰能成为数据中心热门选址,靠的是气候凉爽、低碳电力充足、电网压力小这三件事同时成立。缺一个,账就算不过来。
AI进战场,先骗过的是普通士兵
丕林岛位于曼德海峡南端,沙特石油出口依赖红海。这个地理位置决定了它的分量。
但真正让评论区停下来讨论的,是AI伪造军令这件事的落地方式:克隆指挥官声音,伪造撤退命令,通过Twitter传播,然后对手溃败。
反对派军队缺乏正规指挥链,依赖社交媒体接收命令。AI生成的虚假音视频,在战场压力下仍能成功欺骗普通士兵。这不是技术演示,是已经发生的战果。
把这几条放在一起看,本期HN的底色其实挺清楚:AI在长任务上能跑很久,在合规上能逼出反向激励,在战场上能骗过士兵,在科研里能抹掉摩擦——但摩擦本身,可能才是价值所在。
SCI期刊发表咨询
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

SCI期刊发表辅导
期刊代运营
期刊代运营
快速回复 返回顶部 返回列表