SOTA效果」共找到 1195 篇相关文章

算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
算法论文7

首个多人对话视频生成框架MultiTalk,角色有表情还能互动

现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。

带你学AI
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
开源动态7

字节开源DreamO,一个框架包揽多种图像定制需求

近期图像定制研究展示大规模生成模型潜力,但多数方法通用性有限。字节提出DreamO框架,支持多种图像定制任务,有特征路由约束机制,能解决特征冲突,还介绍其技术原理与各任务效果

带你学AI
产品应用7

实战指南:从零构建 MCP 架构下的 Agentic RAG 系统,无第三方MCP Server

五一期间作者用MCP架构从零实现Agentic RAG系统,分享MCP与Agentic RAG融合思考、架构设计,介绍MCP服务端和客户端实现,还做了端到端效果演示,指出架构优势及待优化处。

AI大模型应用实践
算法论文8

VDC+VBench双榜第一!强化学习打磨的国产视频大模型,超越Sora、Pika

复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。

机器之心
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

量子位
推荐文章8

DevOps之父:发几个Claude Code账号就叫AI转型?Agent用不好是公司的锅

DevOps 之父 Patrick Debois 认为,企业 AI 转型不能仅停留在给开发者买工具,Agent 效果不佳,问题或在公司。开发者要转变思维,改进产出代码的系统,组织要围绕 Agent 重构协作方式。

InfoQ
产品应用8

全球第一! 中国模型登顶榜首,首个可编辑AI语音来了

中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。

新智元
算法论文8

DeepSeek点燃大模型效率之争,阶跃火速接棒:JetSpec让大模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦大模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位