通用视频生成模型」共找到 3305 篇相关文章

算法论文8

DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究

港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。

机器之心
产品应用8

跑通AI Agent「最后一公里」:iMeanAI的WebAgent后训练技术全解析

文章深入解析iMeanAI的WebAgent后训练技术,指出当前AI Agent落地存在从‘理解’到‘执行’的困境。通过两个极限任务展示其能力,介绍核心技术架构和后训练进化引擎,还提及该技术带来的自由体验,其1.0版本已公测。

AGI Hunt
新闻资讯8

港科广等发布首个医学世界模型!精准模拟肿瘤演化,规划治疗方案

医学世界模型(MeWM)是创新AI系统,能模拟疾病演变、预测肿瘤变化,助医生术前评估治疗效果、优化方案。港科广等团队提出该模型,有肿瘤演变模拟等三核心贡献,在多方面实验表现佳。

新智元
产品应用7

The Batch:834 | 更一致的人物与风格

德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。

DeeplearningAI
产品应用7

文档解析OCR全新升级,追平Gemini2.5pro,超越MinerU、碾压Qwen2.5VL-72B

CourseAI介绍PP - StructureV3实战、能力、性能与架构。它在通用版面解析等方面能力强,更新PP - OCRv5提升准确率,超主流OCR方案,轻且速度快,但遇特殊情况需重新训练。

CourseAI
开源动态8

狂涨 9.1K star!最近这款谷歌的AI开源应用,超级火!

介绍Google的实验性应用`Google AI Edge Gallery`,它将生成式AI模型嵌入手机,支持Android和iOS,可离线运行,有多种实用功能,在Github获9.1K star,虽处Alpha阶段但潜力大。

开源先锋
推荐文章7

我用了13年,与SEO前辈们出现在一起。白杨SEO从网站优化到AI搜索优化经历分享,百度SEO不放弃!

白杨SEO分享从网站优化到AI搜索优化经历,讲述入行缘由、职场项目,介绍自由职业业务,分析百度SEO阶段与变化,建议别放弃,还给出对SEO未来看法,如回归国外、做新媒体SEO等。

白杨SEO优化教程
开源动态8

开源即屠榜!UniME多模态框架登顶MMEB全球训练榜,刷新多项SOTA纪录

格灵深瞳等团队联合发布通用多模态嵌入新框架UniME,刷新MMEB训练榜纪录。它是两阶段框架,经文本判别知识蒸馏和困难负样本增强指令微调,在多任务达SOTA,项目已开源。

量子位
新闻资讯8

真能戴出门的脑机接口来了?长得像普通毛线帽,戴上就能意念打字

本文报道Kernel前CEO跳槽EEG脑机接口初创公司Sabi的行业动态,介绍Sabi推出的毛线帽造型非侵入式脑机接口产品Sabi Cap,分析BCI领域不同技术路线的商业化前景,探讨消费级脑机接口的机遇与挑战。

DeepTech深科技
算法论文8

T-RO综述重构Foundation Model时代机器人操作知识版图

近日,论文《Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives》被IEEE Transactions on Robotics接收,它以High - Level Planning和Low - Level Action Modeling为主线,梳理Foundation Model时代机器人操作发展,分析了现存问题及关键缺口。

机器之心