DeFiFlowBench 测试并改进自然语言 DeFi 工作流合成中的安全执行
这个研究团队做了个 DeFiFlowBench 基准测试,用 207 个提示测试了自然语言 DeFi 工作流合成,发现直接、受限和少样本提示在 5% 价格影响下会有 14-19 次不安全执行。他们还提出了 Koan-Safe 模型,在 75 个测试上比最佳基线好很多,能避免不安全执行。
这个研究团队做了个 DeFiFlowBench 基准测试,用 207 个提示测试了自然语言 DeFi 工作流合成,发现直接、受限和少样本提示在 5% 价格影响下会有 14-19 次不安全执行。他们还提出了 Koan-Safe 模型,在 75 个测试上比最佳基线好很多,能避免不安全执行。