日本AI公司Sakana AI搞了个新系统叫Fugu,能让不同模型一起干活,不用只靠一家供应商。效果还跟Anthropic的Fable 5差不多,值得看看怎么做到的。
全部动态
AI 相关资讯全量信息流 · 101 条
6月22日
Sakana AI推出Fugu系统,多模型协作媲美Anthropic的Fable和Mythos基准
6月18日
OpenAI 发布 LifeSciBench 基准,评估 AI 处理生命科学研究任务
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
6月16日
6月14日
6月13日
6月10日
Anthropic 今晚发布最强模型 Mythos
Anthropic 新旗舰模型 Mythos 今晚发布,做 AI 应用开发或模型对比的团队可以第一时间关注,看看它能否在推理和代码任务上超越 GPT-4。
6月9日
6月6日
开源语音模型 Audio Interaction 每 0.4 秒决定是否说话
这款模型解决了实时语音交互中“等待录音结束”的痛点,做语音助手或实时翻译的开发者可以直接在 GitHub 上试玩,体验每 0.4 秒的决策能力。
6月1日
5月30日
Liquid AI LFM2.5-8B-A1B:1.5B活跃参数跑本地Agent,接近4倍参数模型
本地 Agent 开发者终于不用等大模型了——1.5B 活跃参数就能跑出接近 4 倍参数模型的效果,笔记本就能部署,隐私和延迟都解决了,做本地自动化的建议直接试。
5月28日
ITBench-AA:前沿模型在企业IT任务基准测试中得分不足50%
企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。
5月23日
NVIDIA Nemotron-Labs扩散语言模型实现光速文本生成
NVIDIA 的扩散语言模型将文本生成速度推向新高度,做实时对话或低延迟应用的开发者可以直接关注,它可能改变你对大模型推理速度的认知。
5月22日
GPT-4.5 首次实证通过图灵测试:73% 判定率超越真人
这项研究首次用实证数据证明 AI 能通过图灵测试,对关注 AI 社会影响和网络安全的人意义重大——做 AI 伦理或在线身份验证的团队值得仔细看,它会让你重新思考“像人”意味着什么。
IT之家原文
5月21日
5月14日
5月13日
Kimi K2 开源:Moonshot 发布新一代智能体模型
Kimi K2 开源让开发者直接获得了一个在工具使用和推理上超越 GPT-4 的智能体模型,做 AI 应用和自动化流程的团队建议立即上手试试。
5月12日
5月11日