文本质量」共找到 1064 篇相关文章

算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
新闻资讯7

独家 | 腾讯X Lab 韩磊即将离职,将加入诺亦腾科技

AI 科技评论独家获悉,腾讯具身智能技术中心副总经理韩磊 7 月底离职,将加入诺亦腾科技。韩磊在多智能体强化学习成果多,其参与研究登上《Nature Machine Intelligence》2024 封面,加入诺因该司有大量动捕数据。

AI科技评论
开源动态7

这个开源模型的UI审美碉堡了~

当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。

探索AGI
新闻资讯8

MMLab@HKU 闪耀 CVPR 2025!与全球顶尖学者共话 AI 前沿

CVPR 2025 于 6 月 11 日至 15 日在美国纳什维尔举行,MMLab@HKU 携 24 篇高质量论文亮相。其还是三项国际竞赛的发起与主办方,主办六项前沿活动,研究成果展示了多领域进步。

AI科技评论
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
开源动态8

一键抠图有多强?19Kstar 的 Rembg 开源神器,5 大实用场景颠覆想象!

在视觉内容需求旺盛的当下,背景抠图工具至关重要。Rembg 是能在本地完成高质量图片背景抠图的开源利器,累积 19.1K ⭐。本文通过项目详解等带你深度了解它的魅力。

小华同学ai
新闻资讯7

CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现

图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。

量子位
算法论文8

ICML 2025|趣丸研发新型人脸动画技术,声音+指令精准控制表情

广州趣丸科技团队提出新颖肖像驱动框架Playmate,能根据音频和控制条件生成高质量肖像视频,精准控制表情和姿态。成果被ICML 2025收录,代码开源筹备中,在多方面优于现有方法。

机器之心
开源动态8

腾讯Kuikly框架鸿蒙版正式开源 —— 揭秘卓越性能适配之旅

腾讯将广泛使用的跨端开发框架Kuikly鸿蒙版正式开源,已接入多款业务。它有高性能、动态化特点,适配中解决渲染、文本性能等问题,还优化调试效率,发布Compose DSL Beta版。

腾讯技术工程