视频质量模型」共找到 8383 篇相关文章

开源动态7

1.5B参数!支持本地实时语音转录

Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。

AI工程化
产品应用7

实测Gemini图片转视频新功能,终于蹲到经典梗图后续了(doge)

Gemini接入带声音的图片转视频功能,作者实测该功能。用开盒指令测试,生成速度较快;还尝试给梗图加后续,发现生成精确内容需详细提示词,且不能生成具体真人形象内容。

量子位
新闻资讯7

Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型

Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。

AI前线
推荐文章8

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。

机器之心
开源动态8

微软又上大分!刚刚开源一款 0.5B 轻量级实时 TTS 模型,还能边想边说!

2025 年大家致力于解决 AI「嘴巴」问题,追求实时流式对话。微软刚开源轻量级 TTS 模型 VibeVoice-Realtime - 0.5B,参数虽小但能边输入边朗读,有诸多特点和广泛应用场景。

开源星探
算法论文8

视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%

加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。

AIGC开放社区
算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
推荐文章7

规范驱动开发落地经验谈:为什么 AI 编程的关键不在模型,而在协作方式

文章指出 AI 编程关键在协作方式,规范驱动开发(SDD)应运而生。它有诸多价值,但落地面临工具短板等挑战。企业可将其适配现有工作流,长远看需将规范作为动态指南,实现智能体编排开发的质量转变。

AI前线
推荐文章7

对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix

Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。

Founder Park
开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区