「训练方法升级」共找到 4036 篇相关文章
顶级视频模型半衰期只有 30 天,但生成式媒体 infra 公司的收入却在一年增长了 60 倍
文章聚焦生成式媒体 infra 公司 fal.ai,其借统一 API 和云端平台让开发者高效调用多模态模型。深入分析其成功因素,如早期押注生成式视频、优化算力和成本、构建生态等,还探讨用户使用模式与行业发展趋势。
MiniMax都在用!5500PB幕后功臣首次亮相,国产黑马祭出杀招
AI浪潮中,数据流不动致GPU算力空转,XSKY星辰天合举办AIMesh产品战略发布会破局。AIMesh含三网,分别解决IO墙、重力墙、内存墙问题,且开放解耦,获多方认可。
上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
上海科技大学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。
继宇树后,唯一获得三家大厂押注的自变量:具身模型不是把DeepSeek塞进机器人
2026 开年,自变量机器人获字节、红杉 10 亿融资。自变量认为具身智能不是 AI 模型应用,需“生于物理世界、用于物理世界”的基础模型,其有自研成果,还开源模型组织黑客松。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"
在2025云栖大会上,阿里云发布《生成式AI卓越架构设计指导原则》,以云原生“卓越架构五大支柱”为基础,针对大模型内容合规与安全治理等领域提建议,助力企业从‘能用AI’走向‘用好AI’。
AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA
多模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
中科院首提「AI哲学」,万字解读:为自身立命,为AI立心
中科院吴怀宇教授首次系统性提出「AI哲学」体系,以「感智境行」为核心架构,探讨智能本质、人机边界等,为人类应对AI冲击提供认知框架,也为AI赋予意识根基,涉及多学科,具多方面价值。
清华姚班大神陈立杰,联手00后逆向破局!颠覆50年计算机难题
50年来,顶尖科学家死磕「旅行商问题」等计算机复杂性难题无果。清华姚班陈立杰等人在《Reverse Mathematics Below the Turing Jump》论文中,采用「逆向数学」方法,发现许多理论底层逻辑等价,颠覆千年思维范式。