09:07官方一手arXiv: Anthropic@Xun Wang, Bihe Zhao, Michael Backes, Franziska Boenisch, Adam Dziedzic精选73°AgentProv是首个基于行动的身份审计方法,通过分类工具调用分布来识别部署模型。该方法在630个评估检查点对中实现了100%的替换模型检出率,且在系统提示注入下的误报率仅为7%。与MET和RUT相比,AgentProv在第三方API端点上的不一致性与独立令牌计数侧信道检测结果一致。论文AgentProvLLM API工具使用推荐理由:MIT研究团队推出AgentProv,通过工具调用分布检测API是否偷偷更换底层模型,准确率远超现有方法。原文稍后读已读值得跟进有用关注 AgentProv
11:40官方一手arXiv: Anthropic@Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei XiaoKeyPooling是一种测量方法,可追踪客户身份通过缓存查找和写入的路径。研究测试了五个连接OpenAI和Anthropic的开源网关,发现默认情况下没有将客户绑定到上游凭据。在共享凭据下,所有五个网关都暴露了跨客户的缓存读取,覆盖了OpenRouter框架中33.7%的令牌量。研究确定了控制身份转换的关键因素,包括主体分割、命名空间关联和适配器对比。论文KeyPoolingLLM API缓存隔离10 个信源在谈事件专题推荐理由:这篇论文揭示了LLM API中继路径中的缓存隔离漏洞,测试了五个开源网关,提出了防御契约。原文稍后读已读值得跟进有用关注 KeyPooling
03:25elvis@omarsar0Thesean 发布了 Ship 端点的测试版,通过修改 model="original" 为 model="ship-like/original",每次请求固定降低 50% 成本。Ship 保留原有模型的提示词、输出格式和工具行为,在幕后选择最高效的运行方式并匹配原模型质量。如果请求执行成本高于用户支付,Thesean 承担差额。用户可选择削减账单或保持预算不变,运行两倍的智能体、重试和验证来提升输出质量。Ship 已支持 Opus 和 GPT 5.6 Sol,提供 50% 的保证节省和质量 SLA。AI产品TheseanShip成本优化推荐理由:Thesean 的 Ship 让你的 LLM 调用费直接砍半,还能保留原模型名和质量,省下来的钱可以跑更多实验,实用。原文稍后读已读值得跟进有用关注 Thesean
09:22官方账号arXiv cs.AI@Alexandre Belloni, Yan Chen, Yehua Wei该论文提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API。决策者在每个周期观察请求上下文,面临两阶段决策:查询阶段顺序调用API并产生输出相关成本,选择阶段从生成的输出中选一个部署并观察下游奖励。与经典模型不同,该模型输出反馈结构不直接揭示奖励。研究者直接建模保留索引,结合广义矩估计和UCB置信界,实现了维度相关的√T累积遗憾。论文LLM API自适应查询潘多拉魔盒模型推荐理由:LLM API调用成本高、选择困难,这篇论文为开发者提供了理论驱动的自适应查询策略,做模型编排或API调度的团队可以直接参考其方法优化成本与效果。原文稍后读已读值得跟进有用关注 LLM API
08:39官方账号Together AI@togethercompute精选Together AI 的 DevRel 团队发布了一篇关于 LLM 推理引擎的入门指南,解释了 tokenization、调度、prefill、decode、KV 缓存、批处理和流式处理等关键组件如何影响 API 调用的速度、可扩展性和生产就绪性。这些底层系统决定了 AI 原生应用的体验质量。对于开发者而言,理解推理引擎有助于优化应用性能和成本。AI产品推理引擎LLM APITogether AI推荐理由:做 AI 原生应用开发的团队,理解推理引擎能帮你优化 API 调用成本和响应速度,建议点开这篇入门指南。原文稍后读已读值得跟进有用关注 推理引擎