视频大模型」共找到 9472 篇相关文章

算法论文8

ACL 2025 | GALLa:给代码模型装上“透视眼”,看懂程序的“骨架”!

蚂蚁集团与上海交合作的 GALLa 研究被 ACL 2025 主会录用。它利用图神经网络将代码图结构信息注入模型,在 7 个模型和 5 个任务上提升性能,推理与普通 LLM 一致,不增成本。

PaperAgent
开源动态8

阿里开源PromptEcho:用冻结多模态模型为文生图训练提供高质量Reward

阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。

机器之心
新闻资讯8

告别盲目卷参数!科讯飞1024亮出底牌:all in“更懂你”

模型能力趋同当下,科讯飞在1024开发者节提出让AI“更懂你”。展示多模态超拟人“小飞老师”和「百变声音复刻」功能,发布星火X1.5模型,还推出多领域软硬件产品,赋能多行业。

量子位
算法论文8

腾讯AI Lab首创RL框架Parallel-R1,教模型学会「并行思维」

腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。

机器之心
算法论文8

真·开外挂!MIT新研究:架构0改动,让模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
新闻资讯7

Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情

Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力

量子位
产品应用8

真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」

谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时长和使用门槛限制,但已足够震撼。

机器之心
产品应用8

6秒造一个「视频博主」,Pika让一切图片开口说话

8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。

机器之心
算法论文8

上科何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」

上海科技学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。

AI科技评论
新闻资讯8

Artificial Analysis 发布 2025 年 AI 现状 Q3 季报

Artificial Analysis发布2025年Q3 AI现状报告,揭示五关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。

AGI Hunt