8月5日
11:05
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao
论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。
事件专题

推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
08:33
08:33官方账号Simon Willison@simonw
Simon Willison 发布了 LLM 命令行工具和 Python 库的新版本。该工具可用于连接数百种不同的 LLM。此次更新加入了推理痕迹(reasoning traces)功能,并支持 OpenAI Responses 接口。新版还新增服务器端工具和更智能的日志记录。
事件专题

推荐理由:Simon 的 LLM 工具更新了,新增推理痕迹和 OpenAI Responses 支持,一条命令连几百个模型,写脚本更省事。
03:29
03:29官方账号Pika Labs@pika_labs
Pika Labs 推出 API Club,通过单一 API 接入超过100个主流生成式媒体模型,覆盖视频、图像、音频和 LLM。所有模型价格均公开透明,官网列出每个模型与竞品的详细对比。即使 API Club 偶尔定价更高,也会明确标示,方便开发者直接比较。
推荐理由:Pika 搞了个 API Club,一个接口就能调上百个视频、图像、音频和语言模型,价格还全透明,方便比价。
8月4日
09:29
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho
研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。
推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。
06:30
06:30官方账号Yann LeCun@ylecun
精选
Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。
推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。
01:53
01:53官方账号Simon Willison’s Weblog博客/媒体
Simon Willison在Hacker News评论中表示,LLM改变了开源软件自由修改的可行性。他每天多次让Claude执行从GitHub克隆仓库并解释代码的指令。过去编译开源项目常因摩擦而放弃,现在他直接交给Codex或Claude Code处理,十分钟后查看构建结果。他认为一年前还不存在这样的路径。
推荐理由:Simon Willison分享了新工作流:让Claude Code帮你编译开源项目,十分钟后看结果。改代码的门槛突然没了。
8月3日
10:25
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin
FriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。
推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。
07:53
07:53官方账号Simon Willison’s Weblog博客/媒体
condense-json 1.0正式发布,这是一个拥有1.5年历史的Python库。它通过replacements对象将JSON中重复出现的字符串替换为{$r:...}语法,并可用uncondense_json()还原。开发者Simon Willison表示,该库用于压缩LLM生成的SQLite日志,相关实现见PR #1586。此次1.0版本应用了合理且无破坏性的修复,属于稳定版发布。
事件专题

推荐理由:Simon Willison给他的condense-json发了1.0,能把JSON里重复的字符串换成短引用,省存储空间,配合LLM日志用正好。
7月31日
12:17
12:17官方账号arXiv cs.LG@Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser
安全运营中心(SOC)面临告警疲劳,检测量超过人工处理能力。研究团队通过自动提示优化、自训练和可验证奖励强化学习,在真实人工标注的Windows端点检测上训练出链式推理(CoT)分类器。CoT会降低标签token概率,因此另训练校准器读取完整推理轨迹并估计判定正确概率。系统达到82.6%测试准确率,在高置信度操作点下,良性召回率比直接标注的LLM分类器提升43.0%,恶意召回率提升18.3%。未训练的置信度评判会使高置信召回归零,而微调的30B模型显著优于前沿通用模型。
推荐理由:这篇论文把推理模型用在安全告警分类上,82.6%准确率,比直接LLM打标签的恶意/良性召回提升明显,还解决了置信度问题。
7月30日
11:18
11:18官方账号arXiv cs.AI@Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta, Tejaswi Tenneti
该论文提出一种发现增强的搜索系统,利用意图条件召回扩展。采用两阶段混合架构:先使用闭源大语言模型(LLM)优化头部查询,再通过LoRA适配器和师生蒸馏微调小语言模型(SLM)覆盖尾部查询。系统评估使用LLM-as-a-judge指标和端到端会话级购买分析。结果将发现覆盖率从约60%提升至80%,推理成本仅为教师模型的30%。
推荐理由:论文提出一种混合架构,用大模型和小模型结合,将电商搜索发现覆盖率从60%提升到80%,推理成本仅大模型的30%,适合大规模部署。
7月29日
11:57
11:57官方账号arXiv cs.AI@Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He
CHARM是一种多模态图基础模型,通过分层上下文建模解决零样本迁移问题。它用层次化图上下文替代孤立原始节点,捕捉多模态语义和跨模态关系。在多个零样本多模态图任务上,CHARM取得一致改进。
推荐理由:这篇论文提出了CHARM,用分层上下文建模多模态图,不需要目标域微调就能零样本迁移,比现有GNN和LLM方法更通用。
11:40
11:40官方账号arXiv cs.AI@Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang
论文研究多仓库库存分配中MIP公式的实例级选择问题,提出一种求解器引导的LLM框架,通过SFT、IPO和GRPO训练选择器。实验基于京东数据,Hit Ratio@1从21.45%提升至50.42%,Hit Ratio@2从70.47%提升至82.31%,分配质量比固定最优公式高12.57个百分点,与事后最优差距缩小至4.85个百分点。
推荐理由:京东数据验证的一种新方法,用LLM和GRPO自动选库存分配公式,准确率翻倍,搞供应链优化的可以关注。