8月27日
16:03
06:55
8月21日
17:28
17:28IT之家博客/媒体
精选
深度求索发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,支持多模态适配,API 计费按 token 计算,支持 Chat Completions、Messages、Responses 三种格式调用。Files API 已上线,不收费。

推荐理由:深度求索新模型上线,多模态能力提升,API 访问方便,适合各种 Agent 工具集成。
5月19日
10:06
10:06官方账号arXiv cs.AI@Mingyang Rao, Kehua Feng, Zhihui Zhu, Jiangzhen Fu, Hao Yu, Keyan Ding, Huajun Chen
精选
大模型在理解化学反应图方面存在视觉缺陷和语义脱节两大瓶颈。ChemVA框架通过视觉锚点机制和语义对齐方法,将化学结构图转化为模型能理解的实体名称,显著提升理解能力。在OCRD-Bench基准测试中,ChemVA实现92%的结构识别准确率,并在9种不同大模型上平均提升约20个百分点,使开源模型在复杂化学推理任务上媲美闭源系统。
推荐理由:做化学信息学或AI辅助药物研发的团队,终于有了让大模型真正看懂反应图的方法——开源框架可直接用,效果提升明显。