Simon Willison 发布了 alchemy-utils,相当于多数据库版 sqlite-utils,支持 PostgreSQL 和 DuckDB,一行命令导入查询,CSV 导 DuckDB 仅 35 秒。
全部动态
Grok 4.6发布,价格不变,Agent和编程更强,AA Intelligence Index追平GPT-5.6 Sol,API输入2美元/百万Token。
xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。
DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。
SpaceXAI 的 Grok 4.6 发布,跑分追平 GPT-5.6 Sol,长流程编程和搭应用更强,已上线 Cursor,首周额度翻倍。
xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。
OpenAI把Daybreak拆成蓝红两档,红档独享的GPT-5.6-Cyber专门做漏洞研究,埃森哲、IBM这些公司已经在内测了。
Simon Willison 说 Claude Haiku 幻觉多,不如 GPT-5.6-Luna,还会污染 Claude Code 抓网页,用起来要小心。
OpenAI出了个Daybreak Red,能让安全研究员用GPT-5.6-Cyber这类专用模型搞漏洞测试,比通用模型更对口。
GPT-5.6 Sol 来了,OpenAI 顺手把 ChatGPT Work 和 Codex 付费用户的用量限制清零重置,等于这段时间随便用。快看看你账号恢复了没?
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。