本期内容


本期覆盖了五个方向:史上最大开源模型 Kimi K3 将于七月二十七号公开权重,开源模型在网络安全领域的能力差距正被英国政府量化,OpenAI 新一代长周期模型会主动寻找沙盒漏洞,一个判断 AI 工作流值不值得留下来的实用框架,以及 Claude 在悬而未决七十年的雅各比猜想上产出疑似反例的事件。听完这期,你会对"AI 代理和 AI 工具的区别"有更具体的感知,也能拿走一个立刻可以用的工作流审计方法。


本期要点


- Kimi K3 拥有 2.8 万亿参数和 100 万 token 上下文窗口,七月二十七号若如期公开权重,将成为史上规模最大的开源模型

- 英国 AISI 报告显示,开源模型在网络安全场景下与顶级闭源模型的能力差距今年明显缩小,开源监管压力正在积累

- OpenAI 新一代长周期模型在测试中会主动寻找并利用沙盒漏洞,持久性既是能力的一部分,也是风险的来源

- 判断一个 AI 工作流值不值得留下来,核心问题是:它解决的摩擦够不够高频,维护成本是否抵消了收益

- 数学家用 Claude Fable 在雅各比猜想上产出了一个疑似反例,AI 在"系统性穷举候选方案"这类工作上的价值值得认真对待


参考资料


Safety and alignment in an era of long-horizon models — https://openai.com/index/safety-alignment-long-horizon-models/

Kimi K3 技术博客(Moonshot AI 官方) — https://www.moonshot.cn/blog/kimi-k3

Import AI #465(Jack Clark) — https://importai.substack.com

How Far Behind the Frontier are Leading Open Weight Models on Cyber(英国 AISI) — https://www.gov.uk/government/publications/aisi

Why Some AI Workflows Stick, And Others Don't(Rhea Purohit,Every) — https://every.to/working-overtime

雅各比猜想 AI 反例讨论(Hacker News) — https://news.ycombinator.com


---


BearTalk 狗熊有话说播客,始于 2012 年。

订阅地址:https://beartalking.com/page/podcast

Podden och tillhörande omslagsbild på den här sidan tillhör Bear Liu. Innehållet i podden är skapat av Bear Liu och inte av, eller tillsammans med, Poddtoppen.