「模型训推」共找到 8064 篇相关文章
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
从 1000 万 App 下载到 1 亿桌面:千问与夸克合体成 AI 浏览器了
阿里千问 App 公测 7 天下载量破千万,其基于强大的 Qwen 模型。11 月 26 日,千问与夸克 AI 浏览器深度融合发布 6.0 版本,借助夸克超 1.1 亿的装机量,千问成系统级桌面智能助理。
马斯克暴走官宣:Grok 5就是AGI!五月连轰两代万亿怪兽,OpenAI慌了
马斯克宣称Grok 5就是AGI,5月将连发1T和1.5T两代万亿参数模型。Grok 4.3已上线,4.4、4.5将相继推出,Grok 5正以6万亿参数规模训练。不过,参数能否堆出AGI存争议。
云计算一哥10分钟发了25个新品!Kimi和MiniMax首次上桌
亚马逊云科技CEO在re:Invent 2025上10分钟发25个新品,2小时近40个。围绕AI Agent,从算力到模型、平台、应用全面布局,还引入中国Kimi和MiniMax,构建全栈壁垒,助力企业用好AI。
对话心光:在技术与需求的十字路口,我们选择用AI温暖人心
本文是对心光创始人王禹效和徐璐的访谈。心光是笔记类AI陪伴产品,主界面简洁,功能丰富。团队回顾其发展历程,探讨技术与需求关系、模型选择、用户画像等,还谈及盈利模式、创业时机及未来计划。
「上下文学习」之后,腾讯混元第二篇公开研究:精准定位RLVR训练崩溃的“罪魁祸首”Token
腾讯混元团队新研究提出异常梯度定位器 GradLoc,可将全局梯度突刺定位到具体异常 token,降低 RLVR 训练观测与分析门槛,助力解决训练不稳定问题,让模型调优更科学。
幻觉率降 27%、成本忽略不计:GPT-5.3 与 Gemini 新品对今年AI走向释放什么信号?
3月3日,OpenAI和Google几乎同时发布新模型,OpenAI推出GPT - 5.3 Instant,主打日常对话顺畅;Google发布Gemini 3.1 Flash - Lite,强调规模化智能。二者不追高端能力,分别从成本和体验着手,反映AI竞争重心转移。
当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践
在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。
AI改造激光焊接检测!“过杀”率暴降50%,国际头部客户产线已用上
在第三届国际供应链博览会上,广州德擎光学科技的激光焊接在线检测系统展示了AI+先进制造检测落地效果。基于深度学习的AI检测模型,使焊接检测“过杀”率降50%,产线检测精度和效率提升,已用于国际头部客户产线。
揭秘超节点,AI算力需要“统一的语言”
AI大模型热潮带动算力行业发展,中国AI芯片崛起,但单颗芯片算力不足、不同设备沟通有障碍成行业难题。华为发布“超节点”架构与“灵衢”技术,搞出“算力普通话”,目标是让算力系统更高效、灵活、省钱。