10:48官方账号arXiv cs.AI@Dirk Bergemann, Andrew Koh, Stephen Morris精选73°研究人员开发了一种针对AI代理的机制设计框架,这些代理的对齐偏好和能力未知。该框架通过单向模仿结构实现诚实和服从的激励,并揭示了可实施政策的特征。研究团队将此框架应用于五种典型场景,包括能力伪装、对齐与可解释性权衡、同行评分纪律、竞争激励以及可扩展监督和奖励塑造。论文机制设计AI代理对齐推荐理由:这篇论文提出了AI代理机制设计的理论框架,解决了代理能力未知情况下的控制问题,并给出了五种应用场景。原文稍后读已读值得跟进有用关注 机制设计
12:13官方账号arXiv cs.AI@Praphul Chandra, Sujit Gujar, Ganesh Ghalme该论文在 arXiv(2608.06353v1)提出名为 Resourced Authority 的机制设计模型,用于对已部署 AI 代理进行持续参与式治理。其核心是把授权与计算资源分配绑定,通过计算预算让治理决定自我执行,并把这套方案定位为部署方之上的合规/共享层。治理周期被建模为序贯到达的验证人类利益相关者参与的扩展式博弈,贡献以独立于代理计算的治理货币计。净支持经资金聚合器转为广度加权有效支持,再由两阈值滞回门变为二元授权,经安全上限耦合映射释放计量计算预算。作者还刻画了该机制可治理的代理类别,并把被治理代理操纵选民国度的挑战列为开放问题。论文AI治理机制设计计算预算推荐理由:论文提出 Resourced Authority,用计算预算让治理决定自动执行,比纯靠审批更硬核。原文稍后读已读值得跟进有用关注 AI治理