从零训练」共找到 4892 篇相关文章

算法论文7

揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

近年来大模型任务突破离不开RLVR关键技术,许多RLVR方法会进行组内优势估计,北航等最新工作揭示其存在系统性偏差,困难题优势被低估,简单题被高估。这会影响训练,论文提出校正算法。

机器之心
产品应用8

Gemini 3 Pro的位置,Kimi K2.5也想坐坐?

Kimi 发布 K2.5,在视觉编程上表现亮眼。它通过多模态训练涌现审美,能生成美观网页。与 Gemini 3.0 对比各有优势,Kimi Code 开源终端 Agent 功能强大,Kimi 还探索 Agent Swarm 协作新路径。

AGI Hunt
产品应用8

8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队

大模型下半场,后训练特别是强化学习成核心战场。潞晨云微调SDK上线,它是国内首个全面开放、且兼容Tinker范式的Serverless微调平台,为强化学习提供低成本解法,在易用性和成本上有优势。

量子位
开源动态8

开源医疗模型SOTA:蚂蚁健康发布百亿参数医疗大模型

由浙江省卫生健康信息中心、蚂蚁健康等联合开发的AntAngelMed医疗大模型正式开源。它凭借独创训练与架构,在权威评测中表现优异,降低算力门槛,将专业知识、诊疗能力与计算架构融合,为医疗AI落地奠基。

AIGC开放社区
新闻资讯8

海外产业叙事:AMD超威半导体的崛起

文章讲述AMD发展历程,初创小公司成长为半导体巨头。早期靠模仿生产立足,后获x86授权。历经起伏,苏姿丰时代推出Zen架构处理器逆袭。2025年与OpenAI合作,MI450有望打破英伟达垄断。

芯师爷
新闻资讯8

汇丰科技25年丨植根中国,服务全球,加速金融创新和数字化进程

汇丰科技中国 16 人团队成长为全球科技中心,率先用区块链、AI 等技术为全球跨境交易提速。25 年来扎根中国,在技术、人才等方面成果显著,未来将持续提升创新与服务能力。

InfoQ
新闻资讯7

Anthropic被作家告了,违规下载700万本书,15亿美元和解了

AI初创公司Anthropic同意支付至少15亿美元,和解作家集体诉讼。此前作家指控其盗版作品训练Claude。若协议获批,将是美版权案最高赔偿,也是AI公司法律纠纷转折点。

机器之心
新闻资讯8

刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌

2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落后5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。

机器之心
产品应用7

剪映于近日上线两款 AI 产品 - 「小云雀」和「剪小映」

剪映近日上线两款 AI 产品「小云雀」和「剪小映」。小云雀是下一代创作 Agent,可门槛创作视频、图片等,功能多样;剪小映则把「智能成片」细化,通过智能解析提升剪辑效率与创意。

特工宇宙
算法论文7

Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking

文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练

深度学习自然语言处理