QCATS:查询上下文感知的 Transformer 切片框架加速数据库内预测查询
一篇数据库方向的论文:把 Transformer 剪成 FFN 切片塞进数据库里跑预测查询,用 BERT-base 和 Qwen-0.6B 实测延迟降到 1/4.42,精度不掉。做数据库+ML 的人可以看看。
一篇数据库方向的论文:把 Transformer 剪成 FFN 切片塞进数据库里跑预测查询,用 BERT-base 和 Qwen-0.6B 实测延迟降到 1/4.42,精度不掉。做数据库+ML 的人可以看看。