「开放式任务」共找到 1969 篇相关文章
OpenAI新Agent遭中国24人初创团队碾压!实测成本、质量全输惨,海外用户:中国Agent代差领先
今日凌晨,OpenAI 推出 ChatGPT Agent 新功能,能让 AI 助手完成多步骤任务。虽官方称其性能先进,但实际效果有局限。海外用户将其与中国团队产品对比,发现中国 24 人初创团队产品成本、质量更优。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成
新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
让AI作画自己纠错!随机丢模块就能提升生成质量,告别塑料感废片
来自清华、阿里等的团队推出S² - Guidance方法,通过随机丢弃网络模块动态构建子网络实现自我修正。它避免了其他方法繁琐调参,在文生图和文生视频任务中显著提升生成质量与连贯性,且计算高效。
超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练
大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。
从刮胡子机器人到双臂神技!这家具身独角兽引爆亿级美元融资热潮
具身智能大热,Generalist AI展示「拂晓」仿人自适应机器人完成高难度任务。日前,非夕科技宣布完成C轮亿级美元融资。该公司由前DeepMind科学家创立,获英伟达投资,其机器人在多领域有应用。
首发限时免费两周!实测腾讯混元Hy3:Agent能力飞升,日常主力毫无压力
腾讯混元Hy3正式版发布,尺寸300B,在多领域表现亮眼,追平甚至超越大参数模型。作者用三个刁钻场景实测,Hy3在全栈开发、3D游戏开发、办公任务中表现出色,幻觉率低,达生产级标准。
Code Arena全球可用模型第一!智谱GLM-5.2上线并开源
智谱上线并开源GLM-5.2,在Code Arena等平台表现优异,长任务跑分出色,架构有突破,支持100万token上下文,还引入控制功能。模型在常用编程智能体可用,适配国产算力平台,以MIT协议开源。
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。