多模态编辑」共找到 1122 篇相关文章

产品应用7

6K星 Qwen围绕Web AI,打造Agent Search新生态

自Manus带火深度研究代理后,新兴方向面临多模态代理推理能力不足等问题。千问2025年推出系列工具完成web智能搜索生态闭合,本文分享WebWatcher训练及解决问题的方法。

CourseAI
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
推荐文章7

大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
产品应用8

新晋顶流Agent颠覆设计师!Lovart一手实测来了:是该刷屏爆火

新晋顶流Agent Lovart火爆全网,可一句话搞定专业视觉设计,支持二次编辑。量子位实测其设计能力强,背后是多模型融合调度。它定位人机协作,适合中小企业,官网可申请内测。

量子位
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态

花叔
算法论文8

具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统

香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。

机器之心
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。

AI前线
开源动态8

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。

量子位
产品应用7

SkyReels-Audio让嘴型和音频完美匹配不再难

音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。

带你学AI
新闻资讯8

产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路

InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。

AI前线