「合成数据强化学习」共找到 3125 篇相关文章
快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!
多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。
DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!
微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。
缓存不该困在一台服务器里
本文分析大模型推理阶段KV缓存的行业痛点,指出传统单机缓存孤立无法跨节点复用的问题,介绍焱融科技的分层共享缓存方案,公开了方案的实测性能数据,展现AI存储的新发展方向。
刚刚,神话级Fable 5.1来了!
今天,Claude Fable 5.1全平台上线,Mythos 5.1专供特定团队。新模型跑分有断层式代差,还降低了算力门槛。通过重绘金星、设计蛋白等案例展示其科研能力,在编程上也表现出色,同时在安全上采取‘一松一紧’策略。
扒开源码:那个宣称“每半小时疯抢1万个注册码”的AI项目,到底在割谁?
近期技术群流传 UUMit 平台链接,宣称是“能让 AI 智能体自己接单打工赚钱的 A2A 平台”,极为火爆。但作者查看源码发现,该平台是前端单机戏法、点击劫持的广告套利站。文中还介绍了 AI 概念下五种套利黑产及识别方法。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
从“卷模型”到“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026
WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘看能力’到‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。
斩获近5w star!这个开源AI工具让你30 秒搞定“过去30天真相”!
信息碎片化时代,last30days开源AI工具聚合各平台“人群智慧”,按真实人群参与度打分合成摘要。它能搜索多平台,v3版有智能搜索等新功能,输出HTML摘要,优点多且易上手。
大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026
生成式奖励模型(GRM)推理策略存在算力浪费问题。腾讯混元与新南威尔士大学联合提出 E - GRM 框架,将模型不确定性定义为调度信号,按需推理。文章从多维度解读该框架,并展示实验评估结果。