「任务性能」共找到 3553 篇相关文章
Codex 积分制计费上线,Claude Code 急了……
OpenAI Developers宣布Codex推出积分制度,重置速率限制,ChatGPT Plus和Pro用户可买积分获额外使用量,每1000积分40美元。云端任务将计入速率限制,社区反应不一,且积分会过期,Claude Code为挽回用户送会员。
从数据分布视角,重新认识下CoT
本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
具身智能奇点已至!超越π*0.6,极佳视界自我进化VLA大模型拿下世界第一
极佳视界具身大模型 GigaBrain-0.5M*依托世界模型实现自我进化,在多真实任务近 100% 成功,超 π*0.6 成 SOTA。其提出基于世界模型的强化学习范式,用超万小时数据训练,推动通用具身智能发展。
大模型如何泛化出多智能体推理能力?清华提出策略游戏自博弈方案MARSHAL
近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,多轮、多智能体训练提升了模型博弈决策水平,将推理能力泛化到通用多智能体系统,在一般推理任务表现显著提升。
DeepSeek-R1-0528 打榜、20+案例全面实测,全球网友狂点赞:实力堪称R2!
DeepSeek 上新的 DeepSeek - R1 - 0528 让 AI 圈沸腾。它在 LiveCodeBench 榜单飙升至第 4 位,性能逼近 OpenAI 的 o3 高级版。全球网友实测后好评如潮,其在多方面能力出色,且完全开源,引发对 R2 的期待。
时隔九年,中国超级计算机重登世界榜首
当地时间6月23日,第67届TOP500超级计算机排行榜发布,国家超级计算深圳中心的‘灵晟’(LineShine)夺冠,运算速度达2.198 ExaFLOP/S。它仅用CPU,性能超美国El Capitan超20%,引发对未来计算架构思考。
拓宽百年奥运「赛场边界」,阿里云AI让人人皆可上场
阿里云作为2026年米兰冬奥会官方云服务合作伙伴,联合发起全球AIGC大赛,用万相大模型生成冬奥视频参赛。万相Wan2.6性能出色,在画质、叙事等方面表现成熟,让普通人也能在奥运体验中当主角。
字节跳动Seed推出「机器人大脑」Robix:让机器人学会思考、规划与灵活互动
近日,字节跳动Seed团队发布「机器人大脑」Robix,它将推理、任务规划与人机交互整合到单个端到端多模态模型。通过层次化架构分工,它能灵活互动,经三阶段训练,在多方面表现出色,为具身智能体发展奠基。
从 Chat 到桌面 Agent:我在一台旧 Windows 上,看见了办公的未来
本文作者作为Mac老用户,为体验昆仑天工研发的Skywork桌面Agent,找来旧Windows电脑测试。该产品定位是接管电脑工作世界,解决办公任务处理和安全隐私问题,还介绍了其功能和使用效果。