Simon Willison 用 GPT-5.5 写了这个 Web 组件,能自动从 GitHub 链接抓取指定行的代码显示在网页上,带行号,做文档或博客嵌入代码很方便。
全部动态
Bleys 算了一笔账:GPT-5.6 Sol 参数 2-4 万亿、跑在 Cerebras 晶圆上、速度 750 token/s,但价格可能翻倍。想了解下一代超大规模模型怎么造?看这个。
OpenAI 把 GPT-5.6 Sol 放到 Cerebras 上跑,推理速度飙到 750 tokens/s,比常规部署快很多,适合追求低延迟的场景。
OpenAI悄悄改了ChatGPT的logo,蓝底黄标可能暗示新模型系列Sol/Terra/Luna,看看他们葫芦里卖的什么药。
Simon 发布了 sqlite-utils 4.0rc3,主要加了复合外键支持,还修了一堆 issue。用上 Claude 和 GPT 帮忙,少踩不少坑。
OpenAI 下周可能发 GPT-5.6,配额更宽松,专门抢 Claude 用户。同时 Gemini 3.5 Pro 也跳票到 7 月 17 日。想了解前沿模型动态的可以关注。
Claude Fable 5 能把蜘蛛侠荡网变成可玩的 Godot 游戏,而且比 GPT-5.5 少出不少错,做游戏可以试试它。
Refploit能自动修复代码智能体生成漏洞利用时出错的部分,用DeepSeek-V4-Flash在143个Java漏洞上做到80.2%成功率,比PoCGen和GPT-5.4驱动的Codex都强。搞漏洞研究的人可以关注。
企业AI费用爆涨(月花1500万美元)开始限制高级模型,花旗、Adobe、Atlassian都有动作。想知道怎么控制AI成本?看看这些公司的做法。
OpenAI 提议给美国政府 5% 股份,还要让其他 AI 公司跟着做,想用股权分红让普通人分到钱。这事儿还在谈,但已经跟特朗普、商务部长都聊过了,挺有看头。
OpenAI和Anthropic现在每1-2个月发一次新版,谷歌要75天还断过154天,速度差距越来越大了。看看他们怎么用发布节奏建护城河。
想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。
编程Agent技能选不好?这篇论文用自回归解码一次搞定技能组合和顺序,在SkillsBench上直接涨了18到23个点,比传统检索还省token。
OpenAI 搞了个新基准 GeneBench-Pro,专门测模型做复杂生物分析时的判断力,GPT-5.6 Sol 表现很亮眼,比之前强不少。
想搞形式化验证代码生成?这篇论文的 AxDafny 用验证器做迭代修复,把 Dafny 编程题的验证成功拉到 92.7%,比之前的最好方法还高 6.5 个百分点。
这篇论文的方法很实在,用多模态搜索加整体判断,在ARC-AGI-2上做到了72.9%,比GPT-5.2 Pro高了将近19个点,代码还开源了。
这篇论文提出一个叫AutoTrainess的智能体,能自己跑模型训练流程,不用人盯着。在PostTrainBench上比纯命令行强,还能帮DeepSeek-V4涨分。
Anthropic 的 Fable 5 和 Mythos 5 解禁了,但有政府安全条件。OpenAI 的 GPT-5.6 也被限制,引发业界对管制拖慢创新的讨论。
Anthropic 出了 Sonnet 5,能自己规划任务、用浏览器和命令行,比 Sonnet 4.6 强,但比 Opus 便宜,适合想搞 Agent 又不想花大钱的人。