长时程任务」共找到 2449 篇相关文章

算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位
产品应用8

跑通AI Agent「最后一公里」:iMeanAI的WebAgent后训练技术全解析

文章深入解析iMeanAI的WebAgent后训练技术,指出当前AI Agent落地存在从‘理解’到‘执行’的困境。通过两个极限任务展示其能力,介绍核心技术架构和后训练进化引擎,还提及该技术带来的自由体验,其1.0版本已公测。

AGI Hunt
算法论文8

沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o

NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。

新智元
产品应用8

太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗

火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超文本等。其基于端到端实时语音模型,有技术突破。

量子位
产品应用8

波士顿动力机器人进厂打工现逆天操作!3D感知+实时追踪,人类捣乱完全不带怕的

波士顿动力的Altas机器人重磅升级,具备3D空间感知和实时物体追踪能力,可自主执行复杂工业任务。文章还解析其背后技术,包括2D感知、3D感知、物体位姿估计和校准等,团队未来将构建统一基础模型。

量子位
新闻资讯7

ChatGPT 评估员工绩效,评得是真能力吗?

绩效考核季,不少管理者用 ChatGPT 生成绩效评语,认为高效。但文章指出,把关键管理工作交 AI 是‘职业肌肉’萎缩,还给出管理场景下 AI 使用清单,网友也对 AI 辅助绩效评估展开热议。

AI科技大本营
算法论文8

能效翻5倍!他们复刻人脑双记忆通路,造出能效记住上下文的类脑AI芯片

帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。

DeepTech深科技
8

全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030

文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了上下文、MoE与稠密模型路线差异及商业化潜力。

AI科技评论
产品应用8

跨维智能DexWorldModel斩获榜首,世界模型真正的考场在机器人执行里

今年4月,Generalist AI发布GEN - 1,其CEO表示不再将模型归类为VLA。当下VLA和世界模型是具身智能主流技术路线,多数世界模型在机器人任务上有瓶颈。跨维智能DexWorldModel在RoboTwin榜单表现出色,还开源EmbodiChain助力行业。

量子位
新闻资讯7

一场关乎纯度99.9999%的国运之战

2026年,一场围绕电子特种气体纯度的“国运之战”正激烈展开。其纯度要求已严苛至6N乃至更高,这关乎国家科技自立、产业安全。当前中国电子特气市场虽扩大,但本土产业面临外资封锁,国产化突围道阻且

芯师爷