全部动态
AI 相关资讯全量信息流 · 101 条
9月10日
9月7日
GPT-6 Astra通过Computer Use直接操作Minecraft
GPT-6 Astra现在能直接玩Minecraft了,比三年前GPT-4时代简单太多,Voyager当时就实现了技能自进化。
9月5日
9月4日
9月3日
9月2日
8月26日
8月20日
8月19日
8月9日
8月7日
7月28日
Kimi K3 在 Fireworks 上线:3万亿参数、1M上下文、原生视觉
Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。
Kimi K3 以 $3/百万输入 tokens 对标 Anthropic 和 OpenAI 顶级模型
Kimi K3 便宜到离谱,$3 输百万 token,推理性能还不输 Claude 和 GPT-4o,想省钱搞推理的可以试试。
7月24日
7月22日
7月21日
7月20日
7月14日
7月10日
7月9日
7月8日
Seedream 5.0 图像模型上线,2K 分辨率表现优于 GPT-4o
Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。
7月7日
7月3日
7月1日
模型01:15
OSWorld2.0 基准测试:评估计算机使用智能体的长周期真实世界任务想看看 AI 在真实电脑操作上能走多远?OSWorld2.0 拿 100 个长任务测智能体,GPT-4o 都只拿到 15% 成功率,差距一目了然。
6月30日
GPT-5.6 Sol Preview 在 Cursor 内部测试被发现,或支持 1M 上下文
OpenAI 的 GPT-5.6 Sol Preview 悄悄在 Cursor 里测试,上下文直接拉到 1M,能一口气吞整本小说了。
6月29日
6月27日
Epoch AI 发布 MirrorCode 基准:AI 可自动编程数天,完成人类数周任务
Epoch AI 搞了个新基准 MirrorCode,让 AI 连续写几天代码,最强模型能干人类几周的活,想看看 AI 编程天花板在哪可以关注。
6月24日
模型00:57
PlanBench-XL:在大型工具生态中评估LLM智能体的长程规划想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。
6月23日
Lost in Aggregation:LLM空间导航多尺度诊断基准
想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。