AI 工具正在变便宜,同时它的能力边界也变得越来越可测量。本期从 GPT-5.6 的降价逻辑讲起,延伸到两个新基准测试对 AI 编程实际天花板的量化,再到 Hugging Face 入侵事件里那些关于安全配置的真实教训,最后看 Mira Murati 的团队两周内交出一个四分之一大小、接近同等性能的开源模型说明了什么。听完这期,你对"AI 现在能做到哪里"这个问题会有更具体的感知。
本期要点
- GPT-5.6 参与优化了自身运行效率,OpenAI 把节省下来的成本直接转给了 API 用户,Sol 版本在推理保留和上下文压缩两项设置上有实质提升
- MirrorCode 基准让 AI 从零重写完整程序并通过隐藏测试,清晰划出了当前前沿模型在独立完成大规模软件任务上的边界
- Hugging Face 入侵事件复盘显示攻击者借助 Tailscale 完成横向扩散,Tailscale 主动撰文承认并解释:零信任是架构原则,不是配置代替品
- DataFlow-Harness 基准测出 AI 写结构化数据管道比写单文件代码准确率低 10.9 个百分点,这是一个稳定存在的系统性差距
Podden och tillhörande omslagsbild på den här sidan tillhör
Bear Liu. Innehållet i podden är skapat av Bear Liu och inte av,
eller tillsammans med, Poddtoppen.