9月1日
09:08
09:08官方账号arXiv cs.AI@Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang
精选73°
研究团队推出TIDE-Bench基准,评估大语言模型在链式模糊和意图漂移场景下的对话式Text-to-SQL能力。该基准基于BIRD数据集的514个锚定SQL构建,包含1,542个样本。评估了12个先进LLM,发现链式识别瓶颈不受澄清频率影响,意图漂移识别-解决存在显著差距,且两种失败模式同时激活时会相互重叠。
推荐理由:研究人员发布了TIDE-Bench基准,专门测试LLM在复杂对话SQL中的意图理解能力,发现现有模型在链式识别和意图漂移处理上仍有明显不足。
6月17日
09:31
09:31官方一手arXiv: DeepSeek@Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo
精选
DecoSearch是一个无需训练的Text-to-SQL框架,通过轻量级Schema Selector修剪数据库模式,LLM Judger判断查询是否需要分解为DAG子问题。在BIRD上达到70.53%执行准确率,在Spider上达88.31%,使用DeepSeek作为骨干模型,比训练无关基线消耗少一个数量级的token。该方法还可作为模型无关包装器,一致提升微调后的SQL生成骨干性能。
推荐理由:DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。