policy·general

policy

别名
首次出现
2026-05-22
最近出现
2026-09-03
累计提及
396
§ 01综述

Policy在人工智能领域通常指智能体在特定环境下采取行动的策略或规则。近期,policy相关研究在强化学习、机器人控制和大型语言模型等领域取得显著进展。

Policy 近期进展

  • 7.4%的准确率提升来自测试时自进化框架,该框架通过持续优化GUI视觉定位的policy实现了这一突破。
  • 3PO方法通过参数空间探索提升了LLM强化学习性能,展示了policy优化在大型语言模型中的应用潜力。
  • DASH框架针对推理模型的on-policy自蒸馏提出了自适应监督视野,改进了传统policy蒸馏方法。
  • APO框架实现了无监督原子策略优化,用于原子系统3D结构预测,展示了policy在科学计算中的应用。
  • 当前焦点与观察点

    Policy研究正从单一参数优化转向系统级适应,如持续学习研究所示。同时,边缘计算与云端的协同也促使policy推理引擎向实时与扩展性方向发展。值得注意的是,LLM Agent的权限policy框架APPA的出现,反映了AI系统安全与可控性日益受到重视。未来,policy研究可能更加注重跨领域应用与实际部署的平衡。
    § 02相关报道10 条在档
    1. 01
      One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
      arXiv cs.AI
    2. 02
      Amazon Bedrock AgentCore 推出自然语言编写 Dogwood 策略功能
      AWS Machine Learning Blog
    3. 03
      PIHF:将后训练强化学习引入上下文学习的新方法
      arXiv cs.AI
    4. 04
      Surgical WAM:用无动作视频预训练提升手术机器人学习效率
      arXiv cs.AI
    5. 05
      测试时自进化框架提升GUI视觉定位准确率7.4%
      arXiv cs.AI
    6. 06
      参数空间探索新方法3PO:提升LLM强化学习性能
      arXiv cs.LG
    7. 07
      无监督自蒸馏:U-OPSD仅靠模型自身生成提升推理能力
      arXiv cs.LG
    8. 08
      DASH:面向推理模型on-policy自蒸馏的自适应监督视野
      arXiv cs.AI
    9. 09
      持续学习的转型:从参数中心到系统级适应
      arXiv cs.LG
    10. 10
      PhyAI:边缘实时、云端扩展的统一物理AI推理引擎
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/policy