「FutureX 动态评测基准」共找到 975 篇相关文章
腾讯开源了一个通用智能体,又刷榜了GAIA~
腾讯优图实验室开源了 `Youtu-agent`,在深度搜索和工具使用benchmark上表现佳。它不依赖GPT/Claude,有自动智能体生成功能,提供单、多智能体模式,还集成分析平台,可实时调试与离线分析。
LLM的快速、慢速与工具增强思维模式综述
大型语言模型在不同任务中对推理策略需求差异大,策略选择不当会影响效率与可靠性。本文提出双重知识边界框架,梳理LLMs推理模式,将策略选择形式化,还分析了决策因素及策略选择机制。
思维锚点:破解LLM Reasoning黑箱的关键句
文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。
个体如何实现主权AI
文章指出越依赖AI,越要考虑‘主权AI’问题。对个体而言,实现主权AI核心是掌握自身数据等,能随时换底层模型,还介绍积累的四类资产、微调顺序及现实路径。
具身智能空间视觉死穴,终于被最新顶会彻底解决!
招商局先进技术研究院下属实验室提出新的移动数据范式,以极低成本破解 VLA 的空间泛化瓶颈。研究团队识别出 VLA 模型三种捷径学习模式,提出层次化数据解耦策略,该方案在主流 VLA 模型上验证有效。
机器人GPT时刻!英伟达WAM赋予全机器人零样本操作能力
英伟达发布世界动作模型 DreamZero,通过耦合视频生成与动作预测,让机器人有物理直觉,能在陌生环境完成复杂任务。它用异构数据学习,适配不同机体,还经优化实现高速推理。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。
OpenAI官宣:重组完成!非营利基金会手握1300亿美金股权,专注两大领域
OpenAI董事会主席Bret Taylor宣布公司完成资本重组,非营利的OpenAI基金会手握约1300亿美元股权,控制营利性业务。基金会初期250亿美元聚焦健康与疾病治疗、AI韧性技术方案。今晚Sam将直播答疑。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。