全部动态
AI 相关资讯全量信息流 · 290 条
7月24日
7月23日
行业10:42
巴基斯坦法院部署AI助手JudgeGPT,案件审结量增6.3%,投资回报率38~50%巴基斯坦法院用JudgeGPT(GPT-4)一年审结量多了6.3%,投1美元赚38~50美元,成本才1300美元,效率提升很实在。
7月22日
7月21日
7月20日
7月17日
LiveKit 上线 Gemma 4 31B 推理服务,实时语音比 GPT-4.1 快5倍成本六分之一
LiveKit 用 Gemma 4 31B 做实时语音,延迟比 GPT-4.1 低5倍,成本仅六分之一,酒店测试胜出,值得试试。
多语言提示下LLM代码生成质量研究:GPT-4o mini、DeepSeek和Claude对比
想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
Meta和xAI陷入下一代模型陷阱,OpenAI凭借Orion/GPT-4.5成功脱险
博主分析了Llama 4和Grok 4为什么翻车,以及OpenAI的Orion/GPT-4.5怎么稳住了局面,值得一看。
7月15日
Mozilla 2026开源AI报告:DeepSeek V4 Flash月用量18.4T Tokens登顶
Mozilla报告用数据告诉你开源模型有多猛:DeepSeek V4 Flash月用量18.4T Tokens碾压闭源,价格还暴跌50倍。
论文11:37
E3方法让AI Agent按任务复杂度动态分配资源,效率提升显著这篇论文解决了AI agent过度读取文件的问题,E3方法能自动判断任务简单就少干活,在MSE-Bench上省了85%成本,效果很实在。
7月14日
7月13日
论文10:44
QANTA 2026多模态问答:任务特定双智能体架构与置信度校准他们用GPT-4.1-mini和GPT-4.1做两个不同任务,靠置信度校准和数值推理拿了QANTA 2026最高分0.402,不是靠堆模型而是靠策略。
7月12日
7月11日
7月10日
7月9日
论文10:21
LLM代码性能基准再审视:现有测试仅暴露6.11%显著差异这篇论文把EffiBench、EvalPerf等流行代码性能基准的漏洞全翻出来了——1538个任务里只有6%能真正测出差异。他们搞了个多智能体框架自动生成更刁钻的测试,效果直接翻四倍。
7月8日
Seedream 5.0 图像模型上线,2K 分辨率表现优于 GPT-4o
Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。
7月7日
Lilian Weng 博客:Harness Engineering 推动 AI 递归式自我改进
这篇博客把 auto-research、自改进 agent 等方向的工作收成系统框架,想了解 RSI 怎么落地可以看。