AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

deepseek-reasoner

共 2 条相关 AI 资讯
7月24日
09:21
09:21官方一手arXiv: DeepSeek@Qunhui Zhang
论文提出VirtualSet,一种接收者类型化的本体世界接口,替代SQL作为LLM的生成目标。在BIRD基准测试的1072题子集上,VirtualSet配合deepseek-reasoner达到67.5%准确率,比带修复和投票的SQL高4.0个百分点(p=0.00117)。系统通过通用约束投影(GCP)在表达式执行前检查,并利用集合链保留具体接收者类型将无效字段转为类型错误。在30个受控决策用例中,写入链拦截了20/20的幻觉动作体且无假阳性。
论文VirtualSetBIRDdeepseek-reasoner

推荐理由:用VirtualSet替代SQL,让LLM查询出错时提前报类型错误而不是给假结果,BIRD上还比SQL高4个点,很适合做安全决策。
原文
7月22日
11:26
11:26官方一手arXiv: DeepSeek@Qunhui Zhang
VirtualSet提出将LLM的生成目标从SQL替换为类型化的set expressions,通过Generic Constraint Projection在执行前检测类型错误。在BIRD基准的1,072题测试集上,使用deepseek-reasoner模型,VirtualSet达到67.5%准确率,高于直接SQL的63.5%(McNemar exact p=0.00117)。在一个30个动作的防护测试中,VirtualSet成功拦截全部20个幻觉动作且零误报。该方法在保持SQL基准竞争力的同时,提供了写操作前的语义决策保障。
AI模型VirtualSetdeepseek-reasonerBIRD
事件专题

推荐理由:VirtualSet让LLM不用冒SQL幻觉的风险,改天用类型安全的set表达式,BIRD上准确率反超4个百分点,写操作还能拦截瞎编的数据输入。
原文
精选动态早读东盟登录