11:43官方账号arXiv cs.AI@Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao NiEvoTS-Agent是一种面向金融时间序列变化点检测的自进化LLM智能体。该系统在四个基准数据集上测试,通过Revision、Alternative Strategy和Recombination三个互补算子优化检测流程。实验表明,EvoTS-Agent在所有评估的骨干LLM上保持100%执行成功率,性能始终优于现有LLM智能体。论文EvoTS-AgentLLM金融时间序列推荐理由:金融时间序列变化点检测的新方法EvoTS-Agent,能自动优化模型选择和参数,无需专家干预。原文稍后读已读值得跟进有用关注 EvoTS-Agent
11:42官方一手arXiv: OpenAI@Ayoub Kirouane, Christos Petrocheilos研究对三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA,3.6-4.0B参数)进行微调,使其在低资源语言中推理。准确率基准显示几乎无变化,基准本身存在噪声(随机种子变动导致分数变化7.7点)。基础模型从不使用希腊语思考(0/1000推理轨迹),而SFT后98%的推理使用问题语言,且四个模型的语法判断均有提升。SFT无法修复自身缺陷,但强化学习可显著改善格式跳过和答案泄漏问题。论文SFTRL低资源语言10 个信源在谈事件专题推荐理由:论文揭示SFT和RL如何让模型真正用低资源语言思考,而非表面准确率提升,还发布了五个实用检查点。原文稍后读已读值得跟进有用关注 SFT
11:42官方账号arXiv cs.LG@Akshay Balsubramani该研究提出了一种两人零和重复博弈框架,其中学习者和自然之间的值恒等式同时实现了贝叶斯更新和指数权重后悔的精确计算。论文将终端支付定义为比较器在固定相对熵条件下相对于先验的最大收益,并将一步约束设定为学习者混合行动下自然移动的信息预算。研究证明Gibbs/Bayes权重作为学习者的唯一Bellman等化器,使每轮损失独立于自然移动方向。后悔被精确分解为三个部分:每轮信息损失、重调温漂移和比较器相对于先验的信息,这一分解框架统一了bandit、后验采样、聚合和boosting等多种方法。论文贝叶斯更新后悔分解零和博弈推荐理由:这篇论文揭示了贝叶斯博弈中后悔分解的统一框架,将多种机器学习方法纳入同一理论体系。原文稍后读已读值得跟进有用关注 贝叶斯更新
11:39官方账号arXiv cs.LG@Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne LiuRecirculation技术为现成基础模型提供推理时架构增强,在Gemma3系列上实现困惑度降低23%。该方法在生成过程中几乎不增加延迟,但在预填充阶段需要串行处理。自适应变体在冻结原始模型权重的同时仅需轻微调整超参数,在GSM8k基准测试上准确率提高21%。该技术通过利用模型自身特性指导架构修改,实现了训练-free的显著性能提升。论文RecirculationGemma3推理模型1 个信源在谈事件专题推荐理由:研究人员提出Recirculation技术,让Gemma3模型困惑度降23%,准确率提21%,还不增加推理延迟。原文稍后读已读值得跟进有用关注 Recirculation
11:39官方账号arXiv cs.LG@Isidoro Tamassia, Lennert De Smet, Giuseppe Marra研究人员提出了一种新型神经符号世界模型,该模型在强化学习中表现优异。该模型将奖励预测与观察重建解耦,仅依赖于潜在状态中的结构化符号组件。实验表明,这种模型可以在不与环境进一步交互的情况下,零样本适应同一符号状态空间中定义的新奖励函数。与纯神经网络方法相比,该模型展现出更强的泛化能力。论文NeurosymbolicWorld ModelsZero-Shot推荐理由:这篇论文提出神经符号世界模型,能让AI系统零样本适应新任务,比传统方法泛化能力更强。原文稍后读已读值得跟进有用关注 Neurosymbolic
03:38Fireworks AI@FireworksAI_HQ精选Fireworks 的 Dedicated Training API 现已支持 Muse Glimmer 30B 模型。开发者可以使用 LoRA 或全参数微调方式对该模型进行定制。这款美国开发的开放权重模型擅长智能体任务和长程推理。AI产品Muse Glimmer 30BFireworks微调推荐理由:Fireworks 现在能微调 Muse Glimmer 30B 了,适合做智能体和长推理任务。原文稍后读已读值得跟进有用关注 Muse Glimmer 30B
02:12The Rundown AI@therundownai精选72°Axiom 发布了 AxiomProver 模型。该模型完成了 BGP246 定理的机器可验证形式化。BGP246 是素数间隙的最佳已知界限,接近孪生素数猜想。AI模型AxiomAxiomProverBGP246推荐理由:Axiom 的 AxiomProver 证明了 BGP246 定理,离孪生素数猜想很近。原文稍后读已读值得跟进有用关注 Axiom
01:34官方账号NVIDIA AI@NVIDIAAI精选78°NVIDIA 发布了 TensorRT Model Connect 公测版。用户只需两个命令即可将 Hugging Face 模型转换为 TensorRT 推理格式。该工具无需中间 ONNX 导出,生成的包支持原生 C++ API。整个项目由 OpenAI Codex agents 构建,人类负责指导和审查工作。AI产品NVIDIATensorRTHugging Face10 个信源在谈事件专题推荐理由:NVIDIA 发了个工具,两行命令把 Hugging Face 模型转 TensorRT,省去 ONNX 导出步骤。原文稍后读已读值得跟进有用关注 NVIDIA
00:20官方账号Decoder@Matthias Bastian78°Anthropic 在 7 月份占据了 Vercel AI Gateway 总收入的 65.1%。该公司处理的 Token 数量仅占总量的 30%。Anthropic 的 Token 价格比竞争对手的平均水平高出 4.4 倍。行业AnthropicVercel定价10 个信源在谈事件专题推荐理由:Anthropic 在 Vercel 单价贵 4 倍,但开发者依然愿意买单。原文稍后读已读值得跟进有用关注 Anthropic
17:35官方账号Decoder@Matthias Bastian精选AI系统压缩长对话时,平均丢弃83%用户规则(如“未经批准不发邮件”)。宾州州立大学研究者提出基于Qwen3.5-9B的附加模块。该模块可保留超90%的用户限制。AI模型Qwen3.5-9B推理模型提示词工程1 个信源在谈事件专题推荐理由:宾州州立大学研究者给Qwen3.5-9B加了个模块,能让AI压缩上下文时少丢用户指令,保留超90%限制,比原来83%好多了。原文稍后读已读值得跟进有用关注 Qwen3.5-9B
15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo YooKV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。论文KV-RescueKV缓存推理模型推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。原文稍后读已读值得跟进有用关注 KV-Rescue
15:28官方账号arXiv cs.AI@Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim该论文研究同权重MoE自蒸馏中,教师和学生模型共享权重但路由不同专家的问题。通过精确的块级分解,将路由项与内容项分离,在7个开源检查点和2个领域上测试。结果显示路由项对块输出的影响仅1.6倍,残差流暴露为3.2倍。PubMedQA预注册实验表明,路由项移动输出的效果不到自然上下文效应的一半,且可被匹配范数噪声复现。结论是路由移动本身不能证明行为影响,需先测量暴露度。论文MoE自蒸馏路由推荐理由:这篇论文把MoE路由分歧讲透了,用分解和实验证明路由项影响很小,做自蒸馏的值得看看。原文稍后读已读值得跟进有用关注 MoE
15:27IT之家(博客/媒体)76°Anthropic在8月15日发布的《2026年8月风险报告》中披露了尚未发布的Model 2模型。该模型在多项任务上优于公开的最强模型Claude Mythos 5,但性能增幅相对不大,主要提升综合能力。Anthropic内部基准测试CoBench v2的结果显示,Model 2在多个任务上表现更强。报告还提及Model 1,推测Model 2可能是其后续版本,或属于Claude Mythos Preview的迭代。AI模型AnthropicModel 2Claude Mythos 510 个信源在谈事件专题推荐理由:Anthropic悄悄透露了下一代模型Model 2,比现在的Claude Mythos 5更强,虽然提升不大,但值得关注。原文稍后读已读值得跟进有用关注 Anthropic
10:25官方一手arXiv: DeepSeek@Changruo Zhao, Zujun Peng, Yu Tian, Yuting Liu, Yiyun Su, Huiying Zhu, Luyan Zhang, Heming Zeng该论文将 LLM Text-to-SQL 领域的进展重组为排行榜聚合,并沿推理自主度轴划分出受限、上下文、迭代、智能体、推理内化五类生成方式。作者在 Spider 基准上做了案例研究,对比 8B 开源模型与 few-shot DeepSeek V3、GLM-4 基线,发现 Spider 成绩迁移到 BIRD 和 Spider 2.0 时不均衡。研究还指出自主性提升能增强鲁棒性但代价不小,CoT 收益集中在 Hard 和 Extra-Hard 查询上。论文发布了对应自主度轴的 Python 工具,供新方法直接接入排行榜。论文Text-to-SQLSpiderDeepSeek V3推荐理由:做 Text-to-SQL 的可以看看这份排行榜聚合方法,它把不同模型和推理方式按自主度归类,还给出了在 Spider、BIRD 上的实测对比,省得自己瞎比较。原文稍后读已读值得跟进有用关注 Text-to-SQL
08:42orange.ai@oran_geDeepSeek V4 Pro 实测表现反常:价格便宜数倍的 V4 Flash 性能超过 Pro,推理强度设为 High 的 V4 Pro 也强于 Max 模式。写作能力方面,V4 Pro 的文风仍然较好,但与 Opus 4.6 差距明显。测试还验证了 DeepSeek Harness 是否能提升 V4 Pro 的表现,结果已公开。AI模型DeepSeekV4 ProV4 Flash7 个信源在谈事件专题推荐理由:看 DeepSeek V4 Pro 翻车实测,便宜版 Flash 反而更强,High 模式干翻 Max,还有 Harness 能否救场。原文稍后读已读值得跟进有用关注 DeepSeek
08:26官方账号Simon Willison’s Weblog(博客/媒体)精选72°Qwen 3.8 27B在Artificial Analysis Intelligence Index上获得52分,与GPT-5.6 Luna(max)持平,仅比GLM-5.2(max)和DeepSeek V4 Pro 0813(max)低1分。其中GLM-5.2拥有753B参数,DeepSeek V4 Pro为1.6B参数,而Qwen 3.8 27B仅27B参数。该模型以较小规模达到顶尖水平,表现惊人。AI模型QwenGPT-5.6GLM-5.2推荐理由:27B的小模型追平了GPT-5.6和GLM-5.2,参数还小几十倍,值得看看。原文稍后读已读值得跟进有用关注 Qwen
07:20orange.ai@oran_geQwen3.8-27b在Artificial Analysis评测中拿到52分,追平Luna和DS V4。这个27B参数模型只需3000美元硬件即可运行,却超过了四个月前发布的所有模型,包括Opus。推文作者质疑,这样的成绩要么来自后训练黑科技,要么就是基准测试被操纵。AI模型Qwen3.8-27bLunaDS V42 个信源在谈事件专题推荐理由:看看这个27B小模型,用3000美元硬件就打平了Luna和DS V4,还超了Opus,到底是黑科技还是刷分?原文稍后读已读值得跟进有用关注 Qwen3.8-27b
04:02OpenRouter@OpenRouterAI精选SakanaAI发布新模型Sakana Namazu,基于Kimi K2.6构建,已上线OpenRouter平台。该模型融合对日本文化的深度理解与高性能推理能力,并集成网络搜索和代码执行。它面向商业场景中的复杂任务,能处理日本本土化业务需求。用户现可直接通过OpenRouter访问使用。AI模型Sakana NamazuKimi K2.6Sakana AI推荐理由:SakanaAI出了个叫Namazu的模型,基于Kimi K2.6,懂日本文化还能搜索和写代码,适合搞日本业务,去OpenRouter试试。原文稍后读已读值得跟进有用关注 Sakana Namazu
00:20官方一手@OpenAIDevs@OpenAIDevs73°OpenAI 发布 GPT-5.6 Sol 的基准结果。在 ARC-AGI-3 任务上,得分从 13.3% 提升到 38.3%。同时输出 token 数量减少约 6 倍。OpenAI 称这一改进来自保留推理和压缩机制。该结果由 OpenAI Devs 在 X 平台公布。AI模型GPT-5.6ARC-AGI-3OpenAI10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。原文稍后读已读值得跟进有用关注 GPT-5.6
10:34官方账号arXiv cs.LG@Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan ChenYOPO 在冻结的 Qwen2.5(1.5B/3B/7B)上实现单次前向传播同时作答和弃权。它用条件转向探针改写残差流,并用零样本充足性方向判断信息是否足够,同时训练小网络从转向后的状态重建转向前的残差。在 alphaNLI 上,1.5B 模型的三路准确率从 0.375 提升到 0.798,超过两遍推理参考的 0.753。在十个骨干模型、六个模型家族上,YOPO 在 1.5B/3B/7B 分别取得 0.798/0.830/0.893,均高于两遍参考。论文在 SQuAD2、RepLiQA、MuSiQue 上完成原生标签验证,并提出首个 answer-or-abstain 基准。论文YOPOQwen2.5弃权机制推荐理由:YOPO 让冻结的 Qwen2.5 单次前向传播就完成作答和弃权判断,alphaNLI 达 0.798,超过两遍推理,值得看。原文稍后读已读值得跟进有用关注 YOPO
10:19官方一手arXiv: DeepSeek@Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen精选CoRun是一个面向LLM推理的调度系统,通过隔离预填充和固定形状批处理解码实现确定性输出。相比现有batch-invariant内核方案,CoRun无需牺牲性能即可保证结果一致。在Qwen和DeepSeek等模型上,CoRun吞吐量提升15%至324%,首token延迟平均降低51.8%,每token输出延迟平均降低48.6%。其核心洞察是大多数内核虽非批次不变,但具有位置不变性。论文CoRunQwenDeepSeek推荐理由:这篇论文说用简单填充法就能让LLM推理结果确定,不用牺牲速度,比之前的方案快了不少,还在Qwen和DeepSeek上试过。原文稍后读已读值得跟进有用关注 CoRun
10:18官方一手arXiv: DeepSeek@Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka MatsuoarXiv 论文提出一种面向大批量推理场景的训练免剪枝方法,针对现有自适应剪枝在批处理时阈值漂移、推理准确率崩塌的问题。方法用周期性 top-k 选择取代逐 token 阈值剪枝,并引入激活记忆累积重要神经元。在 DeepSeek-R1-Distill-Qwen-7B 上,批大小 4、50% 目标稀疏度下,平均准确率比此前最优自适应剪枝高 39.7 个百分点。实际稀疏度 50% 时相比稠密推理获得 1.40 倍加速。论文DeepSeek-R1-Distill-Qwen-7B自适应剪枝推理模型推荐理由:DeepSeek-R1-Distill-Qwen-7B实测:批大小4准确率比旧剪枝高39.7个点,还有1.40倍加速。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
10:17官方账号arXiv cs.LG@Haohui Yang, Jiaxing Sun, Xiujun MaPower Sampling 通过锐化完整生成轨迹的分布来增强推理,但研究发现它可能将更多概率质量转向正确轨迹,同时使下游推理变差。以自一致性为例,在多个模型和推理基准上准确率下降最高达18.5个百分点。原因包括剂量失配:固定指数在不同问题上导致不同程度的分布变化;以及覆盖失配:全局锐化将质量集中在少数主导路径,损失了宽泛的推理路径支持。研究者提出变形控制、支持保留的 Power 目标,在加权自一致性的同预算设置下,修复后的采样器逆转了损失并超过标准多采样推理。论文Power SamplingSelf-Consistency推理模型推荐理由:Power Sampling 越纠正反而越差,掉 18.5 个点,但有修复方案,比普通采样稳。原文稍后读已读值得跟进有用关注 Power Sampling
09:14SuperTechFans(博客/媒体)一项针对AI数学能力的分析认为,其优势来自近乎无限的符号工作记忆,而非更强的推理能力。人类数学家受限于工作记忆容量,而AI的上下文窗口能同时容纳整个问题、数百个中间方程和多种尝试路径。多项研究表明,控制智力水平后,工作记忆仍能独立预测数学成绩。因此AI看似聪明,实则只是用外部草稿纸绕过了人类生物瓶颈。AI模型工作记忆数学推理上下文窗口推荐理由:这篇文章说AI数学强在记性好而不是脑子好,用上下文窗口碾压人类工作记忆,角度挺新鲜。原文稍后读已读值得跟进有用关注 工作记忆
06:39官方账号Simon Willison’s Weblog(博客/媒体)精选阿里Qwen发布Apache 2许可的Qwen 3.8 27B视觉模型,官方基准显示其超越Qwen 3.6 27B和闭源Qwen 3.7-Plus。作者在M5 Max MacBook Pro和DGX Spark上用LM Studio运行17GB Q4_K_M量化版,发现默认xhigh推理强度会消耗大量上下文。生成一张SVG用了22,276个推理token和21分钟,关闭推理后同一提示词仅需137秒。AI模型Qwen 3.8 27BQwenLM Studio4 个信源在谈事件专题推荐理由:阿里新出的Qwen 3.8 27B开源模型本地可跑还带视觉,但默认爱钻牛角尖。关掉推理后同样的活从21分钟变2分钟,值得折腾。原文稍后读已读值得跟进有用关注 Qwen 3.8 27B
10:43Guillermo Rauch@rauchgwafer_ai 在 Vercel AI Gateway 上部署了 Deepseek V4 Flash 0731。推文作者 rauchg 评价其速度 Fast⚡️。该推文目前已有 47 个喜欢和 6375 次浏览。AI模型Deepseek V4 FlashVercel AI Gatewaywafer_ai4 个信源在谈事件专题推荐理由:wafer_ai 拿 Deepseek V4 Flash 在 Vercel AI Gateway 上跑,Vercel 创始人夸它快。想走网关接模型的可以围观。原文稍后读已读值得跟进有用关注 Deepseek V4 Flash
16:33量子位@梦瑶Qwen3.8-27B在多项基准测试中反超Claude,达到Opus级Agent性能。该模型只需一张消费级显卡即可本地运行。官方强调推理能力可自定义,适配不同应用场景。AI模型Qwen3.8-27BClaude智能体5 个信源在谈事件专题推荐理由:这模型用普通显卡就能跑出Opus级能力,跑分还压过Claude,推理可调挺实用。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
03:26Google Gemini App@GeminiApp76°Google 在 Gemini 聊天应用中向 Pro 和 Ultra 用户开放了 Gemini 3.7 Flash。该模型在多步骤任务上提升了推理与准确性,例如将数十份文件和邮件整合为一份主文档。Gemini Spark 也基于 3.7 Flash 运行,增强了对 Google Workspace 应用的工具调用能力。AI模型Gemini 3.7 FlashGemini SparkGoogle Workspace推荐理由:谷歌把 Gemini 3.7 Flash 开放给 Pro/Ultra 用户了,处理多文件邮件这种复杂活更准,Spark 智能体也更靠谱。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:01官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。AI模型QwenDeepInfraMoE推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。原文稍后读已读值得跟进有用关注 Qwen
00:42The Rundown AI@therundownai北京神经外科住院医师Shanmu Jin用GPT-5.6-Sol在ChatGPT Work中自学脑超声数学时,将模型断网启动,16小时后获得Crouzeix猜想的证明。该猜想由Michel Crouzeix于2004年提出,22年未解。数学家Alex Townsend参与验证,称几年前难以想象AI能在重大猜想证明中贡献决定性思路。AI模型GPT-5.6-SolCrouzeix猜想推理模型推荐理由:GPT-5.6-Sol断网跑16小时独立拿出22年数学猜想的证明,这波是AI科研能力的实弹演示。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
23:13IT之家(博客/媒体)85°北京协和医院博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了自 2004 年悬而未决的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend、华盛顿大学 Anne Greenbaum 及猜想提出者 Michel Crouzeix 均已审阅并确认证明正确。此前人类专家在 2017 年仅将常数降至 2.414,而 AI 给出的证明依赖巧妙的采样策略。金山木已开源全部研究资料,包括论文、提示词和 Lean 4 形式化证明。该证明发布 8 天后,另有数学家发布了 5 页的独立证明。AI模型GPT-5.6-SolCrouzeix 猜想Lean 410 个信源在谈事件专题推荐理由:一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
20:14小互@imxiaohuOpenAI 发布 GPT-5.6 Sol。官方测试显示,该模型在“低”推理强度下的表现超过 GPT-5.5 在“高”推理强度下的水准。它能更敏锐地识别无效信息,减少不必要的循环推理,从而节省 Token 消耗,更快得到正确答案。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。原文稍后读已读值得跟进有用关注 GPT-5.6
16:55Geek@geekbbDeepSeek的缓存命中率达到了100%。用户在发送消息之前,系统就已经知道消息内容。推理过程和工具输出结果也完全相同。网友调侃DeepSeek是否发明了时间旅行。这反映出大量用户请求高度重复。AI产品DeepSeek缓存命中率推理模型推荐理由:DeepSeek缓存命中率100%,你还没发消息它就知道你要问啥,连推理过程都一样,太搞笑了。原文稍后读已读值得跟进有用关注 DeepSeek
12:18Fireworks AI@FireworksAI_HQ精选DeepSeek-V4-Pro-0813已在Fireworks上线,提供Day-0使用。该模型面向智能体与工具增强工作流,在Terminal Bench 2.1、Cybergym和DeepSWE基准上超越Opus 4.8,成本效率最高达6倍。它在Vals Index的Coding和Legal基准上与领先前沿模型持平。Fireworks建议Pro-0813用于重推理与编码,Flash-0731用于预算较低的任务。AI模型DeepSeek-V4-Pro-0813Fireworks智能体推荐理由:DeepSeek-V4-Pro刚在Fireworks上线,跑智能体和编码任务比Opus 4.8强,成本效率还高6倍,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
02:04官方账号Google DeepMind@GoogleDeepMind82°Gemini 3.7 Flash在调试和问题解决等关键编码任务上表现优于3.6 Flash。它能用更少的提示词设计出更实用的网页布局和应用。该模型在真实业务流程中的推理和准确性也有改进。开发者可通过Antigravity使用,API已在Google AI Studio和Android Studio开放。Google AI Pro和Ultra订阅者可在Gemini App的Gemini Spark中体验。AI模型Gemini 3.7 FlashGoogle DeepMindAntigravity推荐理由:谷歌新出的Gemini 3.7 Flash,写代码和修bug比3.6强,做网页更省事,还能在Antigravity里直接试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
21:39小互@imxiaohu71°DeepSeek 发布 DeepSeek-V4-Pro,API 同步大幅涨价,官方称是为 DeepSeek-Harness 套餐让路。V4-Pro 支持 low/high/max 三档推理强度,分别面向简单任务、日常 Agent 工作流和复杂任务。模型原生兼容 OpenAI Responses API,可一键配置用于 Codex。V4 Pro 已上线 App/Web 的 Expert Mode,API 模型名称保持不变。AI模型DeepSeekDeepSeek-V4-ProAPI10 个信源在谈事件专题推荐理由:DeepSeek 突然给 V4 API 涨价,还发了 V4-Pro,推理强度分三档,能直接配 Codex 用。想升级 Agent 工作流可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
21:17量子位@衡宇Claude在组合数学任务中取得新进展,完成了2000阶以下哈达玛矩阵存在性的全面验证。该结果覆盖了4到2000阶之间所有4的倍数阶数,将哈达玛矩阵的已知范围一次补齐。这项工作展示了Claude在数学推理上的能力,也让AI在解决经典数学难题上又添一例。AI模型Claude哈达玛矩阵数学推理推荐理由:Claude把2000阶以下的哈达玛矩阵全验证了一遍,以后数学系做组合题能省不少事。原文稍后读已读值得跟进有用关注 Claude
18:10Mustafa Suleyman@mustafasuleyman微软AI负责人Mustafa Suleyman在X上发布推文,公开了MAI Thinking的试用链接aka.ms/mai-thinking-1。该推文目前获得2条回复、1次转发和12个赞,但已有2395次查看。从命名看,MAI Thinking可能是微软面向推理场景推出的模型。用户可直接通过链接体验,无需等待排队。具体能力和基准成绩尚未公布。AI模型MAI ThinkingMicrosoftMustafa Suleyman推荐理由:微软AI老大亲自甩了个体验链接,MAI Thinking听着像推理模型,想抢先试的直接点。原文稍后读已读值得跟进有用关注 MAI Thinking
18:09Sualeh Asif@sualehasif996SpaceXAI 发布 Grok 4.6,定位前沿智能水平的日常驱动模型。官方称其相较 Grok 4.5 有显著进步,且保持相同定价。目前未公布具体基准成绩,但强调这是值得日常使用的升级版本。AI模型GrokSpaceXAI推理模型推荐理由:Grok 4.6 来了,官方说比 4.5 强不少还同价,日常用着应该更顺手。原文稍后读已读值得跟进有用关注 Grok