后训练策略」共找到 4387 篇相关文章

产品应用7

5张 H800 带来 20 FPS 高保真实时虚拟人生成

传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。

带你学AI
新闻资讯8

Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与全栈豪赌,更是找回了“老谷歌”那个味儿

截至2025年底,Gemini在桌面和移动端单次使用平均停留时长首超ChatGPT,下载量也快速追赶。谷歌将其嵌入自家生态策略见效,这与Gemini 3推出有关,还体现了全栈能力与早期谷歌文化回流。

AI前线
新闻资讯7

DeepSeek-V3.2巨「吃」Token,竟然是被GRPO背刺了

DeepSeek-V3.2发布引起关注,但长思考版本暴露出Token使用效率不佳问题,消耗远超同类模型。这或与GRPO算法缺陷有关,其目标函数存在长度和难度偏置,长度偏置仍是该版本高Token消耗的原因。

机器之心
算法论文8

AI问答,直接「拍」给你看!来自快手可灵&香港城市大学

来自快手可灵团队和香港城市大学的研究者提出「视频作为答案」任务范式,发布VANS模型。它由视觉语言和视频扩散模型构成,通过联合分组相对策略优化算法协同优化,在教学和预测应用上效果超现有模型。

量子位
算法论文8

TPAMI 2025 | AI对抗迁移性评估的「拨乱反正」:那些年效果虚高的攻防算法们

本文第一作者赵正宇来自西安交大,针对现有迁移攻击方法缺乏系统公平对比分析的问题,将其分为五大类,在 ImageNet 上对 23 种攻击与 11 种防御方法开展评估,证实评估缺陷会误导结论,解决有新见解。

机器之心
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
新闻资讯8

OpenAI入股AMD,股价暴涨35%!奥特曼左手黄仁勋,右手苏姿丰,通吃全球算力

OpenAI宣布与AMD达成战略合作,将部署6GW的AMD Instinct MI450 GPU集群,可认购最多1.6亿股AMD普通股,持股比例或达10%。消息公布,AMD盘前股价飙升35%。此前OpenAI也官宣与英伟达合作。

新智元
开源动态8

首个代码世界模型引爆AI圈,能让智能体学会「真推理」,Meta开源

Meta重组的AI部门推出首个代码世界模型CWM,是320亿参数开放权重LLM。它与传统大模型思路不同,能模拟代码执行。CWM在通用编程与数学任务表现不错,Meta还开放相关检查点以支持研究。

机器之心
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
产品应用8

大模型虽好,但恕我直言:在OCR面前,开源小模型更香

作者所在公司项目需处理大量纸质文档,起初考虑云端大模型API调用和开源大模型本地化部署,却因成本高、硬件要求高受阻。经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。

PaperAgent