文本质量」共找到 1064 篇相关文章

产品应用7

蚂蚁多模态统一框架Ming-Omni:能看懂世界、会说话、还能画画

文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,能用于图像、音频生成及多模态交互。

CourseAI
算法论文7

“看懂”指令并做动作!Motion-R1结合COT让角色动起来

大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。

带你学AI
算法论文8

最大的开源GraphRag:知识图谱完全自主构建|港科大&华为

香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模式。该系统利用大模型提取知识三元组并归纳模式,构建了ATLAS系列知识图谱,经测试表现优异。

量子位
开源动态8

开源2天斩获3K标星!开源TTS新星Chatterbox盲测击败ElevenLabs!

文本转语音(TTS)技术发展快,但达顶尖水平仍有挑战。开源TTS新星Chatterbox,开源2天冲上GitHub热榜,星标超3K。它功能亮点多,安装简单,适用于多种场景,性能超ElevenLabs。

开源星探
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
产品应用7

V0 模型直接进驻 Cursor,UI 生成效果炸裂,氛围编码体验再升级。

AI 编码赛道竞争激烈,Vercel 的 V0 发布 AI 模型,可在 Cursor 中使用,还推出新工作流提升 UI 生成效果。文中介绍了 V0 特点、Cursor 设置方法及使用演示,还分析了 Vercel 自研模型的原因。

AI进修生
算法论文8

CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代

中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于预训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。

机器之心
推荐文章8

OpenAI 正式发布企业级 AI 落地实践报告:7大经验教训

OpenAI发布《AI in the Enterprise》报告,分享与7家“前沿公司”合作将AI引入企业的经验教训,涉及提升员工效能等方面,并阐述7条关键经验及案例,还提及企业集成AI工作流等新趋势。

AI寒武纪
开源动态8

GitHub连续霸榜,难怪别人的图表这么高级优雅!

作者让AI画系统架构图效果不佳,朋友推荐diagram-design项目。它是给Agent用的出图技能包,能让AI生成编辑级质量图表,有多种图表类型,具备诸多亮点功能,还介绍了安装使用方法。

开源先锋
开源动态8

空间智能新作,影石开源户外全景重建算法

近日,Insta360 研究院联合高校提出 PanoLOG,首个面向全景输入的大规模户外三维重建工作。它解决全景分区难题,在多基准上取得领先渲染质量与小模型体积,还为户外具身智能等提供新思路。

机器之心