9月2日
15:24
15:24量子位@量子位的朋友们
蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。该系统可处理35PB语料,数据清洗效率提升5.6倍。OmniTable解决了大模型训练数据预处理难题,大幅降低了人工清洗成本。
推荐理由:蚂蚁这套宽表系统能一次性处理35PB语料,效率提升5.6倍,再也不用为洗数据熬夜了。
06:29
06:29官方一手Hugging Face: Blog博客/媒体
BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。
事件专题

推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。
9月1日
13:34
13:34量子位@思邈
83°
复旦Neolab团队在Nature期刊连发六篇论文,提出生命算子概念。该算子实现了从分子到生态系统的全尺度生命推演。研究打通了微观分子与宏观生态之间的建模壁垒。生命算子为理解复杂生命系统提供了新工具。
推荐理由:复旦团队在Nature连发六篇论文,提出能统一全尺度生命建模的生命算子,打通微观分子到宏观生态的壁垒。
07:48
07:48官方一手marktechpost@Asif Razzaq
Keenable AI 开源了 NEEDLE 基准测试工具,每小时重建一次查询集。该基准专门解决搜索 API 读取答案键的问题。测试对象包括具有获取工具的搜索智能体。基准测试防止模型直接下载公共数据集跳过检索过程。
推荐理由:Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。
8月28日
00:26
8月27日
23:45
23:45官方一手marktechpost@Sana Hassan
精选
分析Anthropic的1,440个AI设计蛋白质结合子数据集,评估10个领先的预测器。了解目标身份、表达滴度和共识评分如何影响实验成功,并学习蛋白质设计工作流程中严格的交叉验证最佳实践。
事件专题

推荐理由:想了解AI蛋白质设计的最新进展?这篇教程分析了Anthropic的数据集,评估了多个预测器,不容错过!
8月26日
23:49
22:29
22:18
22:18IT之家博客/媒体
精选
加州大学圣迭戈分校利用高通量DNA测序和机器学习技术,解析了人类基因中“起始子”的DNA序列特征,发现约60%的人类基因含有这一序列。AI模型首次能够对人类基因中是否存在“起始子”进行预测,并解析其DNA碱基序列特征。

推荐理由:这项研究利用AI技术解析了人类基因中的关键序列,有助于我们更好地理解基因表达调控,推荐给对生物信息学感兴趣的朋友。
16:34
16:34IT之家博客/媒体
AI 聊天机器人在语言学习上远逊婴儿,学习效率差距大。婴儿可快速掌握语言规则和词汇,而 AI 需海量数据。斯坦福大学认知科学家指出,婴儿学习语言的能力像奇迹一样,AI 行业面临效率难题。

推荐理由:想了解 AI 语言学习效率的差距?这篇报道揭示了婴儿和 AI 聊天机器人在语言学习上的惊人差异。
16:14
16:14官方账号Simon Willison’s Weblog博客/媒体
AI编写并优化了100万行代码,最终在数百万开发者机器上稳定运行。Paul Dix认为,通过构建验证系统和正确引导,AI能够生成复杂且精密的软件,并持续优化直至完美运行。
推荐理由:Paul Dix分享AI在编程领域的突破,AI生成并优化了100万行代码,比传统编程方式更高效。
16:09
10:00
8月25日
02:43
02:43官方账号Decoder@Matthias Bastian
皮尤研究中心分析了近五十万英文网页,发现自ChatGPT发布以来,超过三分之一的网页显示出机器写作的迹象,商业.com网站包含AI内容的可能性是.edu或.gov域名的十倍。
事件专题

推荐理由:皮尤研究中心发布报告,揭示ChatGPT发布后AI文本在网络上激增,商业网站占比最高,值得关注。
8月24日
22:43
09:38
09:38SuperTechFans博客/媒体
精选
本地大语言模型因推理栈差异导致数学一致性破坏,感觉比实际更笨。匹兹堡拾荒文化展现废金属回收便利性。成为优秀作家需大量阅读。Python编程基础书籍发布。hdiutil在macOS 27中被弃用。Qwen 3.8 27B模型逆向工程商业应用许可证检查。Wi-Fi 8转向提升网络可靠性。MartyPC早期PC模拟器注重准确性。AMD Athlon XP处理器易损坏。NetBSD稳定性改善工作与生活平衡。
推荐理由:了解本地大语言模型表现差异,匹兹堡拾荒文化,成为优秀作家阅读技巧,Python编程基础,macOS命令更新,Qwen 3.8 27B模型逆向工程能力,Wi-Fi 8网络可靠性提升,MartyPC模拟器准确性,AMD Athlon XP处理器易损坏,NetBSD稳定性改善工作与生活平衡。
04:13
04:13官方账号Simon Willison’s Weblog博客/媒体
Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。
推荐理由:Drew Breunig分享了他对Fable的看法,揭示了免费午餐时代的终结,对于关注LLM定价和AI发展的读者来说,这是一篇值得阅读的文章。
8月23日
23:05
17:08
17:08IT之家博客/媒体
皮尤研究中心研究发现,自ChatGPT问世后,新增网页中超过三分之一可能带有AI生成痕迹。研究剔除了ChatGPT发布前的旧网页,只分析新增内容,结果显示35%的网页存在AI创作迹象。
事件专题

推荐理由:皮尤研究中心最新研究揭示ChatGPT后AI生成网页占比,了解AI对互联网内容的影响。
8月22日
21:53
21:53官方一手marktechpost@Michal Sutter
精选
本文探讨了在AI开源课程中,如何通过改变绑定工程来提升编码智能体的性能,并介绍了三种运行智能体循环的方式及其背后的提供商经济学。LangChain的Terminal-Bench实验表明,仅改变绑定工程,相同模型下,智能体排名从30位提升至前5。
推荐理由:这篇来自MarkTechPost的文章深入探讨了AI开源课程中的智能体循环运行方式,对于想要了解AI工程实践的人来说,是一篇非常实用的教程。
20:33
20:33官方账号Decoder@Maximilian Schreiner
精选
普林斯顿大学和加州大学圣地亚哥分校的研究发现,技能主要通过结构化工作流程提升AI智能体,而非增加知识。但随着技能库扩大,智能体找到正确指令的难度增加。

推荐理由:普林斯顿和加州大学的研究揭示了AI智能体技能的奥秘,了解它们如何成功和失败,对AI发展有重要意义。
08:13
8月19日
22:39
22:39IT之家博客/媒体
彭博社报道,‘AI 教母’李飞飞认为科技从业者需更清晰说明 AI 好处,因美国多地抵制 AI 数据中心;皮尤中心显示半数美国人对 AI 趋势担忧超期待;李飞飞参与创建 ImageNet 项目曾助力图像识别发展,其创办 World Labs 获 10 亿美金融资。

推荐理由:李飞飞讲了科技从业者该更清楚说 AI 好处这事,和美国态度比亚洲国家做法不同,能帮咱理解 AI 传播情况。
8月17日
17:08
17:08官方一手pandaily@contact@pandaily.com (Pandaily)
精选
北京大学、StepFun与北京邮电大学提出TensorCast,一种面向大模型基础设施的统一可编程张量生命周期管理抽象。在高并发多轮智能体场景中,TensorCast将中位首Token延迟最高降低93.2%。模型实例启动速度最高提升228.6倍。该方案由三所机构联合提出。

推荐理由:北大和StepFun搞了个TensorCast,把大模型首Token延迟砍掉九成多,高并发多轮对话场景下很猛。