「多尺度生成」共找到 5668 篇相关文章
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
原力灵机的DM0.5登顶具身评测RoboDojo,在记忆维度表现突出,还在其他权威评测中成绩优异。它有强泛化能力,在多场景表现佳。其从数据、架构、效率全面升级,且全面开源,赋能具身生态。
独家解读|2025年AI五大趋势与底层数据革命
2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。
2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里
GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。
豆包上可以体验 Seedance 2.0 了,我已经试了一下。
Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。
以前写文排版60分钟,现在 Claude Code 3分钟
作者分享AI写作系统,用AI梳理复杂逻辑生成配图,进行个性化排版、一键出稿。介绍必需工具如Obsidian、PicGo、Claude Code等,还提供具体配置教程、进阶玩法,如规范写作、生成逻辑图、定制风格。
4K超分Agent修图师来了!一键救活所有模糊照片
传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。
推翻「预测下一个token」范式!微信AI新研究:把token压缩成连续向量更具性价比
微信AI和清华团队提出新范式CALM,把token打包成连续向量,让大模型从预测下一个token转变为预测下一个向量。实验表明它能减少生成步骤,在平衡性能和计算成本时性价比更高。
SIGGRAPH Asia 2025 | OmniPart框架,让3D内容创作像拼搭积木一样简单
香港大学等机构研究者推出OmniPart框架,解决3D内容创作难题,已被SIGGRAPH Asia 2025接收。它将生成任务解耦为两阶段,保证部件独立又能完美组合,质量和效率超现有方法,应用潜力大。
开源真强大,不敢相信,太真实,揭秘8.3k star 开源神器 VoiceCraft 如何封神!!!
VoiceCraft 是多团队合作推出的零样本语音编辑与 TTS 开源项目。它能几秒克隆语音,实现编辑功能,支持零样本文本转语音,在真实场景音频中性能超 XTTS - v2、VALL‑E 等模型,解决了内容创作和编辑痛点。