视听场景理解」共找到 2628 篇相关文章

算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心
产品应用8

AI百科全书SciencePedia:当马斯克Grokipedia遭遇滑铁卢,有个中国团队默默把活儿干了

在知识爆炸时代,传统互联网平台难以满足用户获取深度见解的需求,马斯克的Grokipedia也未达预期。深势科技等团队推出SciencePedia,它能理解知识关系,追踪科学脉络,让真知高效抵达用户。

量子位
算法论文8

Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测

在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。

机器之心
算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。

机器之心
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元
新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
算法论文8

Shopee OnePiece:业内首个融合上下文工程、隐式推理和多目标训练策略的生成式搜推建模框架

2025年生成式推荐发展火热,但工业界落地多在序列化建模,替换传统范式遇阻。Shopee傅聪团队联合人大高瓴学院提出OnePiece范式,是业内首个融合多策略的生成式搜推建模框架,含上下文工程、隐式推理和多目标训练策略。

InfoQ
开源动态8

腾讯开源智能体构建框架

腾讯开源智能体构建框架 Youtu-Agent,灵活高性能,验证性能出色,开源友好成本低。有自动智能体生成等亮点,适用于不同用户群体,涵盖研究、开发等场景,还介绍核心概念,附项目地址。

GitHubStore
算法论文8

谷歌发布首个AI+教育RCT实验,传统教材要凉?

谷歌论文提出Learn Your Way AI增强型教科书系统,有两阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景

CourseAI
开源动态8

交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式

强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。

机器之心