后训练策略」共找到 4334 篇相关文章

新闻资讯8

尖峰对话17分钟全记录:Hinton与周伯文的思想碰撞

7月26日,人工智能教父Geoffrey Hinton与周伯文教授进行17分钟对话,谈及AI多模态大模型前沿、“主观体验”和“意识”等话题。Hinton认为当今多模态聊天机器人已有意识,还探讨了训练善良AI及AI推动科学进步等问题。

机器之心
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。

CourseAI
开源动态8

会“思考”的目标检测模型来了!IDEA提出Rex-Thinker:基于思维链的指代物体检测模型,准确率+可解释性双突破

现有目标检测方法有决策不透明和拒识能力不足问题。IDEA提出Rex - Thinker,引入“逻辑推理链”,构建可解释推理框架,经两阶段训练,在测评中准确率提升,可解释性强,有良好泛化能力。

机器之心
推荐文章8

11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋

AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries分享独特策略,如分业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。

Founder Park
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
推荐文章7

什么是系统提示词?如何逆向提示词?

大语言模型启动时会接收系统提示词,决定其角色、回答风格与安全边界。提示词逆向是试图获取或绕过该提示的行为。本文介绍其作用、逆向手法及开发者防御措施,助于安全使用和设计大模型。

AI Reading Hub
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯7

美国解除Claude禁令,Fable 5与Mythos 5即将恢复访问

美国商务部解除针对Claude Fable 5和Claude Mythos 5的出口管制,Anthropic将恢复两款模型访问权限。此前因安全担忧模型被限制,政策逐步松动现整体解禁,Anthropic还发布了Claude Sonnet 5。

DeepTech深科技
7

Cursor 1.5T新模型放弃Kimi基座!600亿美元股票换Cursor,马斯克第一刀砍向微软GitHub

SpaceX官宣收购Cursor,者获600亿美元股票。Cursor在Compile大会发布1.5T新模型和Origin平台。新模型规模大、从零训练、算力提升;Origin是面向智能体的Git平台,将与GitHub竞争。

InfoQ
算法论文8

让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26

现有生成式离线强化学习方法在复杂连续任务长程规划中易陷入局部合理但全局偏航的窘境。厦门大学和香港科技大学提出MAGE算法,采用自顶向下策略,实验显示其多任务表现出色、推理效率高。

量子位