基准测试成本」共找到 3426 篇相关文章

开源动态8

Gaia2 与 ARE:赋能社区的智能体评测

文章介绍 Gaia2 与 ARE,Gaia2 是智能体基准 GAIA 升级版,能分析复杂行为,与 ARE 框架一同发布。ARE 可模拟复杂真实条件,支持定制。文中对比多款模型,指出当前模型挑战,并说明评测步骤和 ARE 使用场景。

Hugging Face
开源动态8

攻克大模型训推差异难题,蚂蚁开源新一代推理模型Ring-flash-2.0

9月19日,蚂蚁百灵大模型团队开源新一代推理模型Ring-flash-2.0,独创棒冰算法解决训推差异难题,实现稳定训练。该模型仅激活6.1B参数就能打平40B Dense模型性能,降低推理成本

机器之心
开源动态8

里程碑!逻辑智能发布全球首个完全开源语音大模型框架LLaSO,语音AI迎来新纪元

逻辑智能发布全球首个完全开源语音大模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强大基础模型。语音大模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。

AI科技评论
推荐文章7

具身智能还需要一个「五年耐心」

作者与具身智能领域人士交流后认为,具身智能还需「五年耐心」。当下通用机器人进工业产线挑战大,一到两年或迎「GPT - 3.0 时刻」,但到「GPT - 4.0」阶段还需解决数据、硬件等诸多问题。

Founder Park
新闻资讯7

GPT-5:前端开发者的“选择自己的冒险路线”

OpenAI 称 GPT - 5 在前端编码出色,内部测试 70% 时间胜 OpenAI o3,获 Vercel 支持。但部分开发者看法不一,有人体验变差,也有人认为它表现一般,还探讨了其让开发者绕开 React 的可能。

AI前线
新闻资讯8

中国AI芯片大突围,DeepSeek V3.1引爆算力革命

DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。

AIGC开放社区
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
新闻资讯8

谷歌大脑之父首次坦白!茶水间闲聊引爆万亿帝国,AI自我突破触及门槛

AI界传奇Jeff Dean在「登月播客」深度访谈中,回顾个人成长、Google Brain早期故事及AI未来思考。他揭秘诸多细节,还谈到神经网络发展、注意力机制突破、LLM可解释性等内容,也提及未来五年规划。

新智元
算法论文8

首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025

淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。

量子位
算法论文8

超越RAG和DAPT!华人团队新研究引热议:即插即用、无需改变原参即可让模型化身领域专家

华人团队提出比DAPT和RAG更方便、成本更低的方法,即“Memory Decoder”预训练记忆模块。它像“领域知识插件”,即插即用、不改原参,能让Qwen、Llama等模型成领域专家,还降低困惑度。

量子位