「FutureX 动态评测基准」共找到 975 篇相关文章
上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026
上交大与 vivo 团队提出 C²FG 方法,针对当前 diffusion 模型缺稳定可控生成机制问题,通过 score 差异实现动态引导控制。实验显示,该方法能提升多维度指标,改进生成分布,揭示生成机制新方向。
Kimi K2 Thinking突袭!智能体&推理能力超GPT-5,网友:再次缩小开源闭源差距
Kimi K2 Thinking发布并开源,主打“模型即Agent”,能边思考边用工具,连续工具调用200 - 300次。在多评测基准超GPT - 5等闭源模型,代码权重遵循MIT协议,可在官网和应用实测。
AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品
ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。
Agentic AI的第三种范式来了,16家机构提出「伴身智能体」
16家海内外高校与科研机构的22位研究者提出ComBodied Agents新范式,它围绕人的长期状态与主体性构建。论文给出闭环技术框架与评测标准,还提到研究难点与风险,也为产品实践提供指导。
美国开源被中国甩在身后,套壳创业者更遭惨烈清算!OpenRouter CEO:天天乱用高价AI的员工要小心了
顶级科技播客20VC访谈OpenRouter联合创始人兼CEO Alex Atallah。他指出美国开源大模型落后中国,企业怕依赖巨头,AI时代员工成本应动态化,还探讨了模型生态、路由技术等行业热点。
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!
随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。
ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解大模型水印效力与文本质量的两难困境
随着大模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。