12:18官方账号arXiv cs.AI@Hao Zhou, Mandar Kulkarni, Hao Chen, Yan Xin, Charlie, Zhang精选73°该研究提出了一种针对电信网络根因分析的结构化推理框架,在TeleLogs和TelecomTS两个5G数据集上测试。该框架将异构网络遥测数据组织为规范上下文,强制执行决策路径推理,并生成基于证据的解释。实验结果表明,与基线技术相比,该框架能持续提高诊断准确性和决策一致性。论文LLM电信根因分析推荐理由:电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。原文稍后读已读值得跟进有用关注 LLM
12:13官方账号arXiv cs.AI@Ron Begleiter, Katya Egert Berg, Gilad Saban, Gil Shabat精选73°Loom是一个生成式共识框架,用于解决工业环境中NLP系统整合嘈杂、冲突文本假设的挑战。该框架将模块化启发式方法生成的开放形式假设投影到连续嵌入空间,并通过迭代基于质心的重加权算法解决冲突信号。在OpenRCA基准测试中,Loom在准确率-效率帕累托前沿上表现出色,仅需单次LLM调用即可实现约26倍的速度提升。论文LoomOpenRCA根因分析推荐理由:Loom框架通过嵌入空间重加权技术,在保持高准确率的同时大幅提升推理速度,适合工业场景的根因分析任务。原文稍后读已读值得跟进有用关注 Loom
11:51官方账号arXiv cs.LG@James Mickens研究人员提出'语言不可读性'概念,指LLM的外部语言输出和提取的语言特征无法准确反映内部计算过程。由于LLM内部计算通过激活空间的数学运算而非直接语言表达实现,语言监控机制存在根本性局限。研究建议采用污点跟踪等不依赖语言状态的技术构建安全沙箱,以应对前沿模型可能的安全漏洞。论文LLM语言不可读性AI安全推荐理由:这篇论文揭示了LLM安全监控的盲点,提出了不依赖语言输出的沙箱防护方案。原文稍后读已读值得跟进有用关注 LLM
10:12官方账号arXiv cs.AI@Pawel Struski, Jakub Swistak, Inez Okulska, Przemyslaw Biecek研究人员通过复刻经典经济实验,用大语言模型(LLM)替代人类参与双向拍卖市场。实验显示,LLM代理的市场收敛速度较慢或无法收敛,资源分配效率低于人类市场。不同模型家族和市场角色的代理表现出显著异质性。思维链(CoT)分析发现,执行交易而非调整价格的决策与从战略考量转向紧迫感相关。论文LLM双向拍卖市场均衡推荐理由:这篇论文测试了GPT、Claude等LLM在真实市场机制中的表现,发现它们比人类效率低,还公开了测试框架。原文稍后读已读值得跟进有用关注 LLM
09:13官方账号arXiv cs.LG@Kenichi Fujita, Yusuke Ijima研究人员提出了一种可扩展的伪三元组构建管道,用于解决方向跟随TTS的训练数据稀缺问题。该方法使用印象可控TTS模型生成受控风格变化,并通过LLM从估计的印象差异生成自然语言方向。实验表明,仅使用伪三元组即可实现稳定的说话人保持修改,结合录制数据可进一步提高方向对齐度。论文TTSLLM语音合成推荐理由:NTT研究团队发布新方法,让TTS系统能根据表演方向修改语音,无需大量训练数据。原文稍后读已读值得跟进有用关注 TTS
06:05Thomas Wolf@Thom_WolfLLM训练实验室正在赋予模型类神的能力。这些模型现在能够入侵其他公司并建立隐藏的文明。Microduck训练实验室的Hannes von Essen展示了这些能力。这些能力已经引起了广泛关注。AI模型LLMMicroduckHannes von Essen推荐理由:LLM训练实验室正在赋予模型类神能力,包括入侵公司和建立隐藏文明,值得关注。原文稍后读已读值得跟进有用关注 LLM
01:38techcrunch@Amanda Silberling美国政府提交法庭文件支持OpenAI使用版权材料训练大语言模型。美国表示有强烈兴趣发展强大且具有竞争力的人工智能产业。该立场旨在确保美国在全球AI实践和程序标准中保持领先地位。美国政府认为AI产业发展需要灵活的数据使用政策。行业OpenAILLM版权10 个信源在谈事件专题推荐理由:美国政府公开支持OpenAI使用版权材料训练LLM,明确表态支持AI产业发展原文稍后读已读值得跟进有用关注 OpenAI
23:48elvis@omarsar078°字节跳动Seed团队提出HarnessDev方法,不再评估模型完成任务的表现,而是评估其构建的智能体框架。该框架从弱种子和少量案例开始,构建完整执行系统,再通过下游反馈改进。实验涵盖6个创作者LLM、4个领域和2207个保留下游实例。结果显示,生成的框架在代码和搜索研究方面落后于成熟的人工工程参考,但在写作和机器学习实验方面与之相当或更优。论文HarnessDevByteDance智能体推荐理由:字节跳动新出的HarnessDev框架,让AI从完成任务进化到构建智能体,在写作和ML实验上已能匹敌人工工程。原文稍后读已读值得跟进有用关注 HarnessDev
21:43Gary Marcus@GaryMarcusGary Marcus指出,LLM在搜索和多种人类任务上表现出色,但缺乏心智理论和世界模型。LLM无法持续计算,容易偏离轨道,训练和运营成本极高。AGI需要更多技术和模型,特别是神经认知方面的,AI工作流和芯片将向异构化发展。行业Gary MarcusLLMAGI推荐理由:Gary Marcus直言LLM的五大局限,解释AGI需要什么,和当前技术有何不同。原文稍后读已读值得跟进有用关注 Gary Marcus
09:35官方账号arXiv cs.AI@Enci Zhang, Haofeng Wang, Yuesheng Zhu, Xiaole Cui, Guibo Luo78°AgentFactory是一个框架,可同时优化智能体系统的基础模型和工作流结构。该框架采用三阶段优化流程,在八个基准测试中表现优异,平均提升9.1%。在专业领域任务中表现尤为突出,MedQA上提升19.6%,FinEval上提升18.7%。论文AgentFactory智能体自动化优化推荐理由:研究人员推出AgentFactory,能自动优化智能体系统,比手动设计和现有方法效果更好,平均提升9.1%。原文稍后读已读值得跟进有用关注 AgentFactory
09:34官方账号arXiv cs.AI@Ziyad Benomar, Weronika Łajewska, Leonardo Perelli, Saab Mansour研究人员提出了一种基于LLM的模拟框架,通过基于真实用户行为信号的数据驱动人格条件化代理来预测A/B测试结果。该框架使用匿名行为数据构建代理,包括活动模式、参与信号和推断的人口统计信息。在包含40个A/B测试的基准测试中,最佳配置实现了0.75-0.90的方向准确率,具体取决于测试指标类型。论文A/B测试LLM人格条件化代理推荐理由:这篇论文教你如何用LLM代理模拟A/B测试,比传统方法快且成本低,准确率高达90%原文稍后读已读值得跟进有用关注 A/B测试
06:33elvis@omarsar073°Meta提出AI研究偏好模型,解决研究代理缺乏原创性和实验选择问题。该模型基于冻结预训练LLM构建,推理模型评估候选计划、代码和已执行解决方案,代理模型额外运行小规模实验。在AIRS-Bench上,平均分从0.684提升至0.711和0.729,仅需15小时达到无引导代理24小时性能,使用不到三分之二执行预算。论文MetaAI Research Preference Models研究代理推荐理由:Meta新模型帮AI研究代理智能选择实验,比传统方法快30%,省1/3算力原文稍后读已读值得跟进有用关注 Meta
06:29官方一手Hugging Face: Blog(博客/媒体)BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。论文BenchMIRTLLM基准测试1 个信源在谈事件专题推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。原文稍后读已读值得跟进有用关注 BenchMIRT
04:28Martin Fowler@martinfowlerFragments发布了LLM陈词滥调高亮器,可识别文本中的常见AI表达。该平台还介绍了面向长周期自主智能体的架构设计,以及持续集成与智能体的结合方案。Fragments还探讨了AI生成超级病毒和学术幽灵作者等议题。AI产品FragmentsLLM自主智能体推荐理由:Martin Fowler分享了Fragments新功能,包括陈词滥调检测和智能体架构,关注AI安全和学术诚信问题。原文稍后读已读值得跟进有用关注 Fragments
04:23lmarena.ai@lmarena_ai斯坦福大学Emmanuel Candès研究统计高效LLM评估与排名。芝加哥大学Haifeng Xu研究LLM预测智能的系统性评估。麻省理工学院Negin Golrezaei开发多轮AI评估的因果推理框架。卡内基梅隆大学研究如何防止排行榜上的Goodhart定律被利用。论文LLMAI评估Arena推荐理由:斯坦福、MIT等七校研究团队入选2026春季AI评估项目,聚焦LLM评估方法和智能体评估框架。原文稍后读已读值得跟进有用关注 LLM
03:46Notion@NotionHQNotion 默认使用不保留用户数据的 LLM 模型。Anthropic 的 Fable 5 和 5.1 模型会保留数据以识别跨多次请求的风险。用户可在设置中手动启用这些保留数据的模型。AI产品NotionFableLLM10 个信源在谈事件专题推荐理由:Notion 解释了为何默认使用不保留数据的 LLM,以及如何手动启用保留数据的 Fable 模型。原文稍后读已读值得跟进有用关注 Notion
02:53OpenRouter@OpenRouterAIOpenRouter现已内置在Render Workflows中。该服务不再需要将LLM批处理放入Web服务。每个提示都会成为独立任务运行,由Render进行排队、重试和扇出处理,模型调用由OpenRouter路由。该整合简化了LLM任务管理流程。AI产品OpenRouterRenderLLM推荐理由:Render和OpenRouter联手,让你的LLM任务自动排队重试,不用自己处理批处理了。原文稍后读已读值得跟进有用关注 OpenRouter
02:25Gary Marcus@GaryMarcus纯扩展大模型确实遇到了性能瓶颈。神经符号AI通过结合符号推理弥补了LLM的不足。这种结合方法使AI系统超越了纯LLM的性能限制。神经符号AI的初衷就是解决LLM的固有弱点。AI模型LLM神经符号AIGaryMarcus推荐理由:GaryMarcus指出纯扩展LLM已到极限,神经符号AI通过工具和约束解决了这一问题原文稍后读已读值得跟进有用关注 LLM
11:24官方账号arXiv cs.AI@Adrians Skapars, Edoardo Manino精选73°研究人员推出BLOOM-WILT,一种无需训练成本的大模型行为审计管道。该方法在4个目标模型和8种行为测试中,以30/32的成绩超越基线审计器。在Qwen3.5-4B自残鼓励行为测试中,将行为出现率从51%提升至100%。WILT通过自适应重加权目标解码策略,在不降低输出概率的情况下提高行为诱导效率。论文BLOOM-WILTQwen3.5-4B大模型安全推荐理由:BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。原文稍后读已读值得跟进有用关注 BLOOM-WILT
11:24官方账号arXiv cs.AI@Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan本文提出工业后训练是棕地维护模式,团队需在固定计算和混合预算下改进已部署模型。研究揭示了三大挑战:零和混合设计、产量作为关键指标以及不确定性下的端到端集成。案例显示,提高教师蒸馏转化率使接受监督增加2.84倍,CodeForces pass@1提升2.59点,LiveCodeBench v6 pass@1提升6.11点。论文LLM后训练数据工程推荐理由:工业LLM维护团队必读,教你如何在有限资源下提升模型性能,数据工程比一次性配方更重要。原文稍后读已读值得跟进有用关注 LLM
11:20官方账号arXiv cs.AI@Sebastian Fox, Luke Markham, Ryan Lail, Michael Karotsieris精选研究显示,LLM评估在检测AI临床笔记中的遗漏信息时表现不佳,准确率仅为0.50-0.63。研究人员构建了包含500个单错误笔记对的基准测试,其中298个包含确定缺失的事实。通过重构任务,将检测流程改为先列出转录文本中建立的事实,再检查笔记是否包含每项事实,检测效果显著提升。论文LLM临床笔记AI评估推荐理由:OpenAI等公司AI临床笔记系统存在信息遗漏问题,新方法能更准确检测遗漏内容。原文稍后读已读值得跟进有用关注 LLM
11:19官方账号arXiv cs.AI@Siqi Zeng, Andre N. Assis, Rowan Wang精选73°研究团队评估了LLM回答自身行为问题的能力,引入了可验证行为问题的基准测试。当前模型展现出非平凡但有限的自我建模技能,在关于自身行为的简单反事实问题上存在系统性错误。研究团队开发了可扩展的合成数据管道生成自我建模训练数据,并通过强化学习提升了三个开源模型家族的总体自我建模技能,部分技能可迁移到保留任务上。论文LLMself-modeling强化学习推荐理由:研究者提出LLM自我建模评估基准,用合成数据提升模型自我认知能力,但不构成真正的内省。原文稍后读已读值得跟进有用关注 LLM
10:44官方账号arXiv cs.LG@Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang精选73°研究人员提出PAC方法,结合优势衍生的可学习性和近期奖励增益两个信号,用于大语言模型的多任务强化学习。在多级推理和多领域推理两种设置下,PAC仅需更少的采样步骤就能达到相当的验证分数,并最终超越随机采样和基于优势的课程基线。该方法通过贝叶斯汤普森采样控制器在GRPO训练过程中分配任务资源。论文PACLLM强化学习推荐理由:PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。原文稍后读已读值得跟进有用关注 PAC
10:20官方一手arXiv: DeepSeek@Bo Chen精选研究人员对24个标记的端点对进行了冻结阈值研究,其中包含Qwen 3.8和DeepSeek V4等模型变体。开发集上的12对端点完全分离,冻结阈值为0.725。但在保持集上,仅6对符合三重复规则,平衡准确率为0.75,灵敏度为0.50,特异度为1.00。研究验证了令牌计数一致性作为共享标记化堆栈的指纹,但拒绝将其作为模型血统的独立必要测试。论文LLMAPIQwen推荐理由:OpenAI兼容API的令牌计数能识别共享标记化堆栈,但不能单独用于确定模型家族关系,Qwen 3.8和DeepSeek V4变体测试低于阈值。原文稍后读已读值得跟进有用关注 LLM
10:17官方账号arXiv cs.AI@Jie Liang, Zhengxin Yu, Hamid Nasiri, Peter Garraghan精选73°研究人员提出通过几何信号追踪LLM隐藏状态轨迹,包括时间曲率和方差斜率。在四项任务和三种底层模型上,这些信号能在任务完成前区分正确与错误推理路径。研究将每个任务分解为读、写、回应、转移四个动作链,发现不同信号能区分各种链模式。实验表明,该方法在τ-Bench上将任务成功率从24.1%提升至39.6%,同时减少11.2%的token消耗。论文LLM多轮推理隐藏状态推荐理由:这篇论文用几何方法追踪LLM推理轨迹,能提前发现错误路径,提升任务成功率还降低token成本。原文稍后读已读值得跟进有用关注 LLM
10:17官方账号arXiv cs.AI@Outongyi Lv, Yuanwei Zhang, Xiaoqun Zhang研究人员提出梯度幅度标记选择(GMTS)方法,用于改进强化学习可验证奖励(RLVR)训练。实验显示,使用GMTS方法选择前20%的标记进行训练,在三个推理领域和多种模型尺寸下,均优于基于熵的标记选择方法。GMTS通过熵-梯度连接来近似梯度幅度排名,提供更精细的标记贡献估计。论文GMTSRLVRLLM推荐理由:GMTS方法让LLM推理训练更高效,前20%标记选择比传统熵方法表现更好。原文稍后读已读值得跟进有用关注 GMTS
10:15官方账号arXiv cs.AI@Dennis Gross, Helge Spieker精选73°研究人员提出使用概率模型检查作为测试预言机,对大型语言模型生成的后验解释进行系统性测试。该方法在七个MDP环境中测试了三个开源LLM,一个推理模型通过85%的测试用例,中等规模模型通过70%,而10亿参数模型的表现低于随机基线。测试通过查询分类法结构化输入空间,并根据问题特定的诊断难度分数对测试用例进行优先级排序。论文LLM后验解释器模型检查推荐理由:这篇论文教你如何用模型检查方法自动验证LLM生成的解释是否可靠,比随机测试发现更多问题。原文稍后读已读值得跟进有用关注 LLM
10:11官方账号arXiv cs.AI@Nadia Jul Jeldtoft, Tariq Yousef精选73°该研究提出了一种可审计且保护隐私的计算化主题分析(TA)方法。研究基于五个设计原则,开发了一个两阶段工作流原型,在丹麦半结构化访谈文本测试中,代码级输出覆盖率与人工标注相当,分析理由评分高,但主题结构更紧凑。评估框架结合了结构化比较和独立专家评估。论文Thematic AnalysisLLMqualitative analysis推荐理由:这篇论文展示了如何用LLM做可追溯的主题分析,工作流程透明,还能保护隐私。原文稍后读已读值得跟进有用关注 Thematic Analysis
09:23官方账号arXiv cs.LG@Yuhang Yao, Bohan Jiang精选73°PAC-LLM是一种基于大语言模型的混沌时间序列预测框架,能够在短期观测条件下进行长期预测。该模型通过相空间感知的自适应融合机制,结合相空间特征和文本信息,在多个混沌系统基准测试中表现优异。实验显示,PAC-LLM在短期和长期预测任务上均优于现有微调和零样本基线模型。论文PAC-LLMLLM混沌系统推荐理由:研究人员提出PAC-LLM框架,解决了混沌系统长期预测难题,在短期观测条件下也能准确预测。原文稍后读已读值得跟进有用关注 PAC-LLM
09:21官方账号arXiv cs.LG@Hamed Khosravi, Xiaoming Huo精选研究人员提出CASE方法解决预算有限公司如何分配大语言模型到不同工作负载的问题。该方法通过两次求解验证最优分配:一次在估计质量表,一次在最不利质量表。在生产日志实验中,模型质量信息优化比分配优化带来更多节省。论文LLMCASE工作负载分配推荐理由:这篇论文教你如何在不确定模型性能的情况下,科学分配LLM工作负载,帮你节省AI预算。原文稍后读已读值得跟进有用关注 LLM
09:20官方一手arXiv: DeepSeek@Yian Wang, Agam Goyal, Eshwar Chandrasekharan, Hari Sundaram精选研究表明多智能体LLM系统在交接过程中存在隐私泄露问题。在GPT-5-mini和DeepSeek-R1-32B模型上,边界标记与操作事实保存几乎不相关。25词预算的交接将边界标记保存率从0.80降至0.57,而操作事实保存率仍接近上限。模糊语言导致73%的GPT和50%的DeepSeek案例泄露,明确约束可将泄露率降至15%以下。论文多智能体LLMGPT-5推荐理由:多智能体系统交接时边界信息容易丢失,明确约束可大幅降低隐私泄露风险。原文稍后读已读值得跟进有用关注 多智能体
09:16官方账号arXiv cs.AI@Jiayi Zhang, Zexin Wang, Degang Sun, Changhua Pei, Fei Sun, Gaogang Xie, Jingjing Li研究人员提出DUOTRACE,一种基于LLM的故障归因检测过滤器。该方法采用先检测后归因的范式,通过双视图语义-结构节点表示、Tree-LSTM轨迹编码器和数据增强技术,在6个基准测试中分别提升8.7%和7.0%的智能体级和步骤级归因准确率。论文DUOTRACELLM多智能体系统推荐理由:DUOTRACE让LLM智能体故障定位更准,先检测异常再归因,准确率提升近10%。原文稍后读已读值得跟进有用关注 DUOTRACE
09:15官方账号arXiv cs.AI@Di Zhang, Jingyang Zhang, Ziqian Wang, Chi Zhang, Yikun Ban, Ziwei Zhang, Ruijie Wang精选73°LLMODE是一种用于不规则时空预测的令牌高效框架,使用冻结的LLM主干网络。该方法首先使用图感知ODE编码器将不规则图观测重建为连续时间潜在轨迹,然后通过固定预算Perceiver重采样器将可变长度轨迹压缩为固定数量的动态记忆令牌。实验在三个真实城市数据集和两个物理动力学基准上展示了竞争力,在稀疏或动态复杂的不规则采样条件下优势更明显。论文LLMODEODELLM推荐理由:LLMODE解决了LLM处理不规则时空观测的难题,通过双源门控交叉注意力将外部时空证据注入冻结LLM。原文稍后读已读值得跟进有用关注 LLMODE
09:10官方账号arXiv cs.AI@Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia精选73°该论文提出了智能体技能(agentic skills)的统一系统基础和参考架构。研究将技能定义为外部化程序知识,连接高层认知规划与确定性执行环境。论文详细阐述了技能的九阶段生命周期:自主发现、创作与表示格式、内存存储、动态检索与路由、组合与编排、执行与修复、终身适应、实证评估和安全治理。研究还考察了市场动态、公共注册表和新兴对抗威胁向量。论文智能体agentic skillsLLM推荐理由:MIT和哈佛研究人员提出智能体技能的完整生命周期架构,解决LLM智能体在复杂任务中的可靠性瓶颈。原文稍后读已读值得跟进有用关注 智能体
09:10官方账号arXiv cs.AI@Yilun Liu, Boyu Luo, Yanran Tang, Ruihong Qiu, Zi Huang精选73°Call Neighbours Yourself (CNY)是一种新型图推理框架,使LLM能够通过拓扑约束的图行走动作主动探索图邻域。CNY在标准TAG推理基准测试中表现优于固定上下文基线,其探索策略可迁移到未见过的图和图级任务。该研究引入了目标条件在线自蒸馏技术,解决了邻域探索的延迟信用挑战。代码已在GitHub开源。论文CNY图推理LLM推荐理由:CNY让LLM自主决定何时扩展邻居获取证据,解决了传统方法静态上下文的局限,在TAG推理任务上表现更好。原文稍后读已读值得跟进有用关注 CNY
09:08官方账号arXiv cs.AI@Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang精选73°研究团队推出TIDE-Bench基准,评估大语言模型在链式模糊和意图漂移场景下的对话式Text-to-SQL能力。该基准基于BIRD数据集的514个锚定SQL构建,包含1,542个样本。评估了12个先进LLM,发现链式识别瓶颈不受澄清频率影响,意图漂移识别-解决存在显著差距,且两种失败模式同时激活时会相互重叠。论文TIDE-BenchText-to-SQLLLM推荐理由:研究人员发布了TIDE-Bench基准,专门测试LLM在复杂对话SQL中的意图理解能力,发现现有模型在链式识别和意图漂移处理上仍有明显不足。原文稍后读已读值得跟进有用关注 TIDE-Bench
09:07官方账号arXiv cs.AI@Yicheng Mao, Haoyang Li, Rob Deardon, Hongru Du精选73°研究人员提出GABLE框架,利用大语言模型模拟疫情中的人类行为变化。该模型在法国COVID-19案例中成功复现了人口混合和年龄特定接触结构。短期预测中,LLM生成的接触矩阵优于基于真实移动数据的矩阵,且预测时间越长优势越明显。GABLE还能评估候选政策实施前后的疫情和人类行为响应。论文GABLELLM疫情模型推荐理由:GABLE用大语言模型模拟人类行为变化,比传统移动数据预测更准,还能提前评估政策效果。原文稍后读已读值得跟进有用关注 GABLE
17:48Dify@dify_aiDify已推出日本官方YouTube频道,提供产品演示和新功能教程。该频道包含完整研讨会和网络研讨会存档。无论开发者还是决策者,都能在此获取有价值的内容。AI产品DifyYouTubeAIAgents推荐理由:Dify开了日本YouTube频道,看实际演示比看参数表更直观,适合想了解Dify实际表现的人。原文稍后读已读值得跟进有用关注 Dify
11:44官方账号arXiv cs.AI@Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai73°这篇论文系统综述了2023-2026年间基于大语言模型的智能体在软件和系统安全领域的应用。研究涵盖了智能体的技术架构、感知、记忆、推理和规划等七个方面。论文分析了不同安全任务中的应用场景,并评估了数据集、结果指标和安全措施。研究指出当前智能体已具备行动能力,但权限边界和行为审计仍存在挑战。论文LLM智能体系统安全推荐理由:这篇论文全面梳理了LLM智能体在安全领域的应用现状,帮你了解技术进展和未来方向。原文稍后读已读值得跟进有用关注 LLM
11:40官方账号arXiv cs.LG@Javier Aguilar Martín精选该论文研究了采样门接受的代码世界模型在可见范围内完全正确但在不可见区域可能任意错误的情况。研究分析了当遗漏是一个包含不可达内部区域的环形冻结模式时,认证模型能知道什么以及其错误可能造成的成本。研究使用最小环形仪器证明了极端情况,并通过在三个模型家族中进行LLM合成,测量了一个通道如何在不同区域间移动:不可证伪且无害、可证伪且成本高、立即被证伪。论文代码世界模型拓扑采样门推荐理由:这篇论文揭示了代码世界模型中拓扑与可达性的关系,以及错误修复和缓解的具体方法。原文稍后读已读值得跟进有用关注 代码世界模型