「任务执行能力」共找到 4803 篇相关文章
全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点
2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。
腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”
视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。
RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈
大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。
GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂
为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。
LangChain 推出开源异步编码智能体 Open SWE
LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。
首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025
淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。
鹿明发布NexCore:当机器人技能成为一种基础设施
8月19日鹿明机器人发布具身智能进化引擎Lumos NexCore,试图在数据、模型等与机器人间建立生产与运行链路,让机器人能力成可复用‘技能资产’,解决具身智能技能生产效率问题。
AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」
近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。
用Codex做跨境电商:第二章
本章探讨为何选Codex承载跨境电商工作方法。它将多种功能置于同一工作环境,适合跨境卖家沉淀业务资产。Codex不仅能写代码,还能围绕项目完成读材料、写产出、受控执行等任务。
直面LeCun愿景,智在无界发布最强具身世界模型,20万小时人类视频屠榜6大榜单
智在无界作为人类视频学习路线开创者,4月14日发布第三代旗舰模型Being - H0.7,用20万小时人类视频训练,提出新范式,在6项权威评测中综合排名全球第一,拓展了世界模型能力边界。