「多任务学习」共找到 6233 篇相关文章

开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI
算法论文8

AI「学不会」竟成相变探针!UCSD华人联手谷歌等,曝光量子纠缠秘密

加州大学圣地亚哥分校华人学者Wanda Hou等与Google Quantum AI合作,在谷歌超导量子处理器实验,发现机器学习模型‘学不会’对应量子体系测量诱发相变,AI失效成物理探针,还展望了量子AI前景。

新智元
算法论文8

如何改变AI研究范式?谷歌DeepResearch新方法TTD-DR原理与实现 | 原理篇

谷歌提出新的DeepResearch方法TTD - DR,它模拟人类研究范式,将Agent起草的初稿视为‘含噪声输出’,经多轮检索 - 改进使初稿成高质量终稿,还引入自进化机制,测试显示其在复杂任务上领先。

AI大模型应用实践
算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式

当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
算法论文8

DeepMind率先提出CoF:视频模型有自己的思维链

DeepMind在Veo 3论文中提出帧链CoF概念,类比语言模型CoT,让视频模型能时空推理。实验显示Veo 3有通用视觉理解能力,能零样本解决视觉任务,未来通用视频模型或取代专用模型。

量子位
新闻资讯7

OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude

OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。

机器之心
开源动态8

京东AI一揽子开源!超多核心项目全开源,GitHub万star项目也有新进展了

京东系统性开源系列AI能力,从大模型到Agent等。JoyAgent 3.0升级,开源DataAgent和DCP模块;OxyGent多智能体框架让开发者自由组合。还有京医千询2.0等,意在推动AI在各行业落地。

量子位
推荐文章8

18 年 SEO 增长经验专家:别再收藏各种 AEO 最佳攻略了,自己动手实验才是做好的关键

18年SEO增长经验专家Ethan Smith与Lenny对谈,指出网上多数AEO信息不准确,做好AEO要自己动手验证。还分享AEO玩法、与SEO区别、优化策略等,强调100%AI生成内容不可行,要优化帮助中心内容。

Founder Park
新闻资讯8

「AI助手」真来了?谷歌牵头推进Agent支付协议AP2

近日谷歌宣布推出 Agent 支付协议 AP2,这是开放共享协议,为 Agent 和商家交易提供通用语言,解决授权、真实性、问责问题,还支持多种支付类型,已和 60 多个企业合作且在 GitHub 公开项目。

AINLPer
开源动态8

2.3K Star 霸榜GitHub!DeepResearch最佳开源平替!

DeepResearch能递归拆解复杂任务自动生成报告,但OpenAI的相关产品费用高且闭源。霸榜GitHub的ROMA由Sentient AGI团队开发,性能超Grok - 4等,是开源杀手,还介绍了功能、使用方法和应用场景。

开源星探