全部动态
企业AI费用爆涨(月花1500万美元)开始限制高级模型,花旗、Adobe、Atlassian都有动作。想知道怎么控制AI成本?看看这些公司的做法。
普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。
NVIDIA 开源了这个工具,让 AI 代理能直接调用分子模型做药物发现。用上它任务完成率翻倍还省 Token,做生物计算的同学可以试试。
OpenAI 出了三个新模型 Sol、Terra、Luna,Terra 和 GPT-5.5 差不多但便宜一半,Luna 超低价。还改了缓存计费规则,省钱又灵活。
想知道你用的AI聊天机器人有没有政治立场?《华盛顿邮报》测了GPT-5.5、Grok和Gemini 3.1 Pro,结果左倾现象普遍,连Grok都没逃过。来看看数据。
Google 把屏幕操控塞进了 Gemini 3.5 Flash,OSWorld 得分和 GPT-5.5 差不多。开发者直接用 API 就能做自动化,很实在。
Simon 用 Claude 和 GPT 帮你把 MDN 浏览器数据转成了 SQLite,能直接用 Datasette Lite 在线查,超方便。
OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。
OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。
OpenAI出了Daybreak工具,用Codex Security自动找漏洞,GPT-5.5-Cyber帮你验证修复,搞安全的可以看看。
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。
Cloudflare 这招挺实用:免注册部署 Workers,60 分钟内自动回收,很适合临时测试或 AI agent 调工具。
马斯克说国产大模型要等到2027年才能追上Anthropic的Fable,但智谱的唐杰直接回怼用不了那么久。GLM-5.2刚在编程测试上赢了GPT-5.5,差距正在缩小。
OpenRouter用多个便宜模型拼出顶级效果,成本砍半但性能追上Claude Fable 5,预算有限又想用好模型可以试试。
谷歌新榜单实测,Gemini 3.5 Flash 在安卓开发任务中得分低、成本高,性价比远不如 DeepSeek V4 Flash。
Simon Willison 发布的 datasette-agent 新版本让你可以安全地用自然语言操作数据库,写操作需要你点头,还能用 --unsafe 一键自动批准,适合快速原型。
OpenAI 的 IPO 动向和 GPT-5.6 的发布计划直接关系到 AI 行业格局和投资机会,关注 AI 赛道和模型进展的读者值得点开了解。
做全栈或跨平台开发的团队,如果被难复现的 bug 和平台适配折磨,可以看看 Nextdoor 怎么用 Codex 提效——直接复用他们的思路,能省下大量调试时间。
从毒瘾到开源重建人生的故事能激励任何处于低谷的开发者,看完会感受到社区的力量;多巴胺压裂概念戳中了算法时代体验贫瘠的痛点,做内容或产品的团队值得反思。
安全团队和AI开发者可以直观看到不同模型在真实漏洞利用任务中的性价比——GPT-5.5最可靠但贵,DeepSeek V4 Pro成本极低但成功率有限,做自动化安全测试的团队值得参考这个对比。
边缘计算和 Node.js 开发者可以看看 Wasmer 如何用 Codex 把数月工期压缩到几周——AI 辅助编程在基础设施层落地了,值得借鉴。
生命科学团队终于有了专为药物研发设计的 AI 模型——GPT-Rosalind 结合智能体编程和工具使用,做药物发现和实验设计的科研人员可以直接用起来,加速研究流程。
Datasette 用户和 AI 安全研究者值得关注——这个沙箱方案解决了 AI 生成代码的安全执行痛点,GPT-5.5 都未能逃逸,做数据分析和 AI Agent 的可以试试。
这次更新让 ChatGPT 用户能按需选择 AI 的思考深度,日常快速问答和深度分析都能兼顾,重度用户值得试试这个隐藏手势。