T2V 模型」共找到 8423 篇相关文章

新闻资讯7

OpenRouter模型7月排名:谷歌遥遥领先,DeepSeek 令牌份额占比超越Anthtropic

OpenRouter公布7月模型排名,按模型令牌份额占比,谷歌以43.2%遥遥领先,DeepSeek 19.4%超Anthropic,OpenAI仅5.9%。编程领域Claude sonnet 4占比第一,谷歌Gemini 2.5pro进步大。

AI寒武纪
算法论文8

解决扩散模型过拟合的创新框架T-LoRA

预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。

AIGC开放社区
产品应用8

整整21个月,豆包大模型正式进入2.0时代!

时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。

量子位
新闻资讯8

世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑

近日,Manifold AI 研发的世界模型 Worldscape 0.2 在 WorldArena 榜单夺冠,此前 WorldScape 0.1 也登顶 WorldScore。该模型参数规模小,进化靠 MoE 架构,展现国产世界模型实力。

机器之心
推荐文章8

端到端语音模型:从语音表征到模型架构

本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。

InfoQ
开源动态8

“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!

7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。

AI前线
开源动态8

Code Arena全球可用模型第一!智谱GLM-5.2上线并开源

智谱上线并开源GLM-5.2,在Code Arena等平台表现优异,长任务跑分出色,架构有突破,支持100万token上下文,还引入控制功能。模型在常用编程智能体可用,适配国产算力平台,以MIT协议开源。

AIGC开放社区
产品应用8

小红书提出社交大模型RedOne 2.0:兼听、敏行

在SNS内容爆炸式增长的当下,传统SFT训练方法有局限。小红书NLP团队推出RedOne 2.0社交大模型,采用以RL为核心的三阶段渐进式训练方法,实验显示其性能优异,还能转化商业价值。

量子位
开源动态8

阿里开源14B电影级视频模型!实测来了:免费可玩,单次生成时长可达分钟级

昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,可在通义万相官网免费体验,单次生成时长可达分钟级。

量子位
开源动态8

杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源

杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。

AIGC开放社区