后训练课程」共找到 3794 篇相关文章

算法论文7

揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

近年来大模型任务突破离不开RLVR关键技术,许多RLVR方法会进行组内优势估计,北航等最新工作揭示其存在系统性偏差,困难题优势被低估,简单题被高估。这会影响训练,论文提出校正算法。

机器之心
产品应用8

Gemini 3 Pro的位置,Kimi K2.5也想坐坐?

Kimi 发布 K2.5,在视觉编程上表现亮眼。它通过多模态训练涌现审美,能生成美观网页。与 Gemini 3.0 对比各有优势,Kimi Code 开源终端 Agent 功能强大,Kimi 还探索 Agent Swarm 协作新路径。

AGI Hunt
开源动态8

开源医疗模型SOTA:蚂蚁健康发布百亿参数医疗大模型

由浙江省卫生健康信息中心、蚂蚁健康等联合开发的AntAngelMed医疗大模型正式开源。它凭借独创训练与架构,在权威评测中表现优异,降低算力门槛,将专业知识、诊疗能力与计算架构融合,为医疗AI落地奠基。

AIGC开放社区
新闻资讯8

海外产业叙事:AMD超威半导体的崛起

文章讲述AMD发展历程,从初创小公司成长为半导体巨头。早期靠模仿生产立足,获x86授权。历经起伏,苏姿丰时代推出Zen架构处理器逆袭。2025年与OpenAI合作,MI450有望打破英伟达垄断。

芯师爷
新闻资讯7

Anthropic被作家告了,违规下载700万本书,15亿美元和解了

AI初创公司Anthropic同意支付至少15亿美元,和解作家集体诉讼。此前作家指控其盗版作品训练Claude。若协议获批,将是美版权案最高赔偿,也是AI公司法律纠纷转折点。

机器之心
新闻资讯8

刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌

2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。

机器之心
新闻资讯7

创始人“背刺”员工获财富自由,Devin接盘火速兑现员工期权,华人CEO暗讽:做个人吧!

当地时间7月14日,Devin背公司Cognition宣布收购Windsurf。此前Windsurf收购案波折不断,创始人带部分人去谷歌,剩下员工去了Devin。此次收购引发对AI编程工具竞争的讨论,也暴露一些行业问题。

AI前线
算法论文8

快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!

多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。

AINLPer
新闻资讯7

突发!曝阿里通义薄列峰离职,此前为应用视觉团队负责人

五一节爆料阿里通义实验室应用视觉团队负责人薄列峰于4月30日离职。他曾带领团队做出爆款功能,现加入某互联网大厂。今年2月语音团队负责人鄢志杰也已离职,接替人选均成谜。

量子位
8

量子芯片离商用还有多远?解读半导体的下一代革命

本文深度拆解量子芯片全产业链,指出其成突破半导体产业天花板核心方向。全球多技术路线并行研发,虽有进展但距商用有差距。其商用面临三重壁垒,将分阶段落地,普及会重塑产业与社会,与传统芯片互补。

芯师爷