两阶段推理」共找到 3144 篇相关文章

算法论文8

破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o

腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。

机器之心
产品应用7

回归C++: 在GGUF上构建高效的向量模型

Jina AI分享将纯解码器向量模型适配到GGUF格式及在llama.cpp工具链的优化经验。经处理得到特定任务v4模型,还生成量化版本并上传。介绍使用方法、注意事项,经测试推荐IQ3_S或IQ3_M版配合定制工具。

Jina AI
产品应用7

GPT-5 不是技术新范式,是 OpenAI 加速产品化的战略拐点

文章从不同视角评价 GPT - 5,指出它是 ChatGPT 产品重要升级,是 Router 驱动系统。介绍其能力提升与短板,如 Vibe coding 性价比高但 Agentic 能力不足,还探讨了商业影响、价格战等,期待其 Agentic 能力发展。

海外独角兽
新闻资讯8

OpenAI深夜祭出GPT-5,所有人能免费用!Altman:像和博士级专家对话

北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推GPT - 5 - mini和GPT - 5 - nano款新模型,免费用户可使用部分版本。它在编程和健康领域测试表现出色,引发各界热议。

InfoQ
产品应用7

WAIC最强亮点:非Transformer离线AI大模型已大规模量产,大模型商业比我们想得更快

在WAIC上,RockAI推出非Transformer离线AI大模型Yan 2.0 Preview,有视觉感知跃升和自主学习能力大提升。该公司走非Transformer路线,着重场景落地,通过“标杆战略”推动产品量产,未来构想构建“群体智能”世界。

AI科技评论
新闻资讯7

Grok 4基准测试被爆极其优异,人类终极考试成绩飙升到45%,碾压o3 和Gemini的20%

API开发者曝光Grok - 4和Grok - 4 Code测试成绩,HLE达35%,推理后飙升到45%,远超o3和Gemini的20%。其他测试也表现优异,但成绩引发争议,有人质疑数据污染,也有人支持,目前数据未官方证实。

AGI Hunt
新闻资讯8

@所有开发者:Agent变现,阿里云百炼联合支付宝首创「AI打赏」!Agent Store全新发布

2025年是Agent元年,不过很多项目卡在POC阶段。6月25日阿里云百炼3.0全新升级,联合支付宝推“Agent打赏”功能,还上线Agent Store。此外,它升级多模态RAG和MCP能力,推出多模态交互开发套件。

量子位
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
产品应用8

拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?

多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。

AI科技评论
新闻资讯7

o3-pro正式推出!说声“嗨”就花了80美元,思考1+1用时16分钟

OpenAI推出推理模型o3 - pro,同时o3降价80%。官方测评o3 - pro表现佳,但价格贵、响应慢。o3‘是否降智’引争议,奥特曼发小作文探讨AI对人类社会影响,还透露公开权重模型推迟。

量子位