「评测榜单」共找到 1220 篇相关文章
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。
老思维做 Agent,没戏!云厂商们又想憋大招了
企业落地 Agent 经历快速演化,自主性 Agent 成新趋势。云厂商起初推 AI Infra,现转以 Agent 应用为中心开启 Agent Infra 赛道竞争,虽已布局但新开发范式未成型,未来需产业链协作迭代。
刚刚,OpenAI发长篇论文:大模型幻觉的原因找到了~
OpenAI发论文揭示语言模型出现幻觉的根本原因,即训练和评估过程奖励猜测而非承认不确定性。预训练阶段就埋下幻觉种子,后训练阶段‘考试机制’强化幻觉,还给出改评分规则的解法。
小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源
小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。
真实物理加持,人物动画再也不像塑料人!UIUC华人让角色活起来了 | ICCV'25
PhysRig是UIUC与Stability AI联合提出的面向角色动画的可微物理绑定框架。它用物理建模替代传统绑定权重设计,解决传统LBS无法克服的问题,显著提升角色动画真实感,还适用于动作迁移任务。
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。
AI版Office全网首测,键盘鼠标彻底退休!打工人沸腾
昆仑万维天工超级智能体(Skywork Super Agents)结合Deep Research和通用Agent优点,带来AI版office。它有超能Office「六件套」,六大卖点亮点足,具五大自研硬核实力,填补市场空白,有望成智能体赛道黑马。
“大脑在硅谷,身体全靠中国!”机器人泰斗揭秘真相:后空翻只是杂耍,端起咖啡才是真AI
在最新一期播客中,机器人学泰斗 Sergey Levine 与 Ryan Peterman 深度对话,触及行业焦点如机器人发展阶段、波士顿动力淡出原因等。他强调,机器人技术尚处底层搭建期,需重视先验知识、软硬件结合,跨越鲁棒性门槛。
RoboScience机器科学发布轮式仿人形通用机器人REX G1,让机器人真正成为新一代具身生产力伙伴|甲子光年
8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1,搭载自研的Visics通用具身大模型,面向多场景打造,能完成完整任务闭环。它将移动与操作融合,适应真实环境,具强大泛化能力且续航佳。