「训练成本」共找到 3393 篇相关文章
多模态Qwen3-VL-Embedding开源&技术剖析
互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。
字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放新秘诀
字节跳动Seed团队推出新一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供新思路,推出加宽模型、线性三角注意力等方法。
MiniMax都在用!5500PB幕后功臣首次亮相,国产黑马祭出杀招
AI浪潮中,数据流不动致GPU算力空转,XSKY星辰天合举办AIMesh产品战略发布会破局。AIMesh含三网,分别解决IO墙、重力墙、内存墙问题,且开放解耦,获多方认可。
GPT-5.2连肝7天,300万行代码造出Chrome级浏览器
Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。
上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
上海科技大学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
比iPhone更疯狂!乔布斯去世15年后,「最像他的人」操刀首款AI硬件
2026年1月,OpenAI首款硬件“Sweetpea”路线图泄露,9月将发布。其形似“蛋石”充电盒内藏耳后设备,搭载顶级芯片,成本高。Jony Ive操刀设计,目标取代iPhone,OpenAI首年计划产销4000 - 5000万台。
《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"
在2025云栖大会上,阿里云发布《生成式AI卓越架构设计指导原则》,以云原生“卓越架构五大支柱”为基础,针对大模型内容合规与安全治理等领域提建议,助力企业从‘能用AI’走向‘用好AI’。
“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将大淘汰,拼的是世界模型?
InfoQ采访真机智能刘智勇,探讨具身智能领域进展、技术瓶颈及商业方向。刘智勇指出,VLN技术有进展但导航成功率待提升,世界模型可提升机器人能力,2026年本体厂商将收缩,盈利是核心。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。