FutureX 动态评测基准」共找到 975 篇相关文章

产品应用7

我雇了个AI,替我读微信列表里“吃灰”的公众号文章

文章评测了AI工具语鲸,它像国产版NotebookLM和AI版今日头条,能处理文本、整合资讯。它可订阅多渠道账号,有订阅、频道等实用功能,网页端解析长文出色,但处理图文有问题,其团队背景强大。

量子位
算法论文7

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。

机器之心
算法论文8

都说记忆是Agent标配,但MemSyco发现漏算了一件事

厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。

PaperAgent
算法论文8

一篇最新自演化AI Agents全新范式系统性综述

传统LLM Agent工作流固化,面对动态环境只能人工硬编码,成本高、迭代慢。此55页综述提出“Self - Evolving AI Agents”新范式,让Agent自主优化自身结构,还给出三定律、统一框架及各类优化方法。

PaperAgent
新闻资讯8

“千问奶茶”在二手平台6元转售;追觅俞浩:年终奖最高20个月奖金,总量会达到10亿级;京东001号快递员:退休金4000多,存款百万|AI周报

这是一份AI周报,涵盖行业热点、大模型发布等多方面信息。有追觅俞浩高额年终奖计划,马云现身阿里千问项目组引发‘千问奶茶’活动热潮,还有域名交易、企业收购、模型发布及应用等动态

AI前线
新闻资讯7

全球最大AI榜单塌房!52%高分答案全是胡扯,硅谷大厂集体造假?

2025年底,《LMArena is a cancer on AI》一文引发关注,其指出LMArena这个权威大模型评测平台问题严重。Surge AI调查发现,52%获胜回答事实错误,39%投票结果与事实相悖,Meta还曾为榜单优化模型。

新智元
产品应用7

物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界

WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。

带你学AI
产品应用8

杭州再出黑马,中国千亿市场被炸穿!AI「杀死」会计,达摩院大佬出手了

杭州精算家的「深蓝财鲸」炸穿国内千亿财税市场,实现90%降本。它具多智能体协作框架与动态策略进化引擎,冲击传统代账公司和中小企业财务岗,其团队来自达摩院,对标美国巨头Intuit。

新智元
新闻资讯7

真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge

Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。

新智元
开源动态8

让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板

百川智能发布医疗推理大模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。

量子位