端到端训练」共找到 4156 篇相关文章

新闻资讯7

理解与生成统一多模态模型:现状与未来 | 直播预约

从GPT - 4oGemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。

深度学习自然语言处理
开源动态8

音画同步视频生成重磅开源!Character AI和耶鲁大学推出Ovi,让音、画在一个大脑里思考

Character AI和耶鲁大学团队推出开源模型OVI,它采用双骨干交叉模态融合架构,让音视频同步生成。其架构对称,用旋转位置嵌入技术对齐时间,训练策略分步进行,生成效果佳,为开源音视频生成提供新路径。

AIGC开放社区
算法论文8

vivo突破手机AI部署难题,绕开MoE架构限制,骁龙8 Elite流畅运行|ICCV 2025

在AI多模态时代,‘让大模型上手机’成焦点。现有MLLM在手机部署有难题,vivo AI研究院等团队提出GenieBlue方案,绕开MoE架构限制,在骁龙8 Elite芯片手机流畅运行,保持语言性能同时实现多模态表现。

量子位
新闻资讯7

刚刚,全球第一CRM收购AI Agent平台Moonhub

今日凌晨,全球第一CRM平台Salesforce收购AI Agent平台Moonhub,Moonhub团队将加入开发Agentforce。此前Salesforce已收购Informatica,其CEO看好AI Agent,愿景是2025年底开发十亿个智能体。双方在HR智能体功能各有亮点。

AIGC开放社区
算法论文8

ICML 2026 巡礼:注意力效率革命的九个切面

7月7日,ICML 2026进入正会第一天。雷峰网精选首日上午9篇论文,涵盖持续学习、多模态融合等方向,如MePo让预训练模型学会持续学习,HAF解决模态不平衡下的融合问题,展现AI研究前沿趋势。

AI科技评论
算法论文8

首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。

新智元
产品应用8

360 如何用 AutoMQ 解决千亿级 Kafka 冷读难题

360 集团作为互联网安全公司,业务数据规模膨胀,Kafka 集群运维难题凸显。AutoMQ 存算分离等特性适配 360 需求,360 验证其性能后用于日志检索平台,解决冷读难题,未来将推广更多业务线。

InfoQ
开源动态8

Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana

北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。

AI工程化
算法论文8

让LLM扔块石头,它居然造了个投石机

港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
产品应用8

AI视频生成走向“演技生成”时代,生数科技Vidu全球发布Vidu Q2 | 甲子光年

9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,实现从“视频生成”“演技生成”跨越。它在表情生成、运镜、语义理解、时长选择等方面有提升,分闪电和大片模式,已在多上线。

甲子光年