快速生成模型」共找到 8855 篇相关文章

开源动态8

170次搜索+50次反思:用GLM-4.7盘点2025 Agent行业趋势,结果太震撼!

作者给智谱新开源的GLM - 4.7布置调研2025年Agent赛道企业的任务,结果令人震撼。该模型进化显著,能整理详细企业信息,还能生成高审美PPT。国内有不少特色AI落地企业。

探索AGI
开源动态8

震撼发布!最大人体动作数据集 MotionMillion 正式登场

上海交通大学研究团队构建高效标注流程,发布最大人体动作数据集MotionMillion,含超2000小时、200万条文本 - 动作配对数据。还推出评测体系MotionMillion - Eval,训练70亿参数动作生成模型,刷新SOTA。

带你学AI
新闻资讯7

Redis 之父:哪怕被喷我也得说,AI 远远落后于人类程序员!开发者跟评:用大模型气得我自己写代码都有劲儿了

Redis 之父 Antirez 分享研发经历,认为人类程序员比大模型出色,人类能打破常规想出更有效解法。他在修复 Redis 复杂 bug 时,与 Gemini 2.5 PRO 交流,凸显人类创造力优势。开发者看法不一,AI 虽成工具但缺创造力。

AI前线
产品应用8

刚刚,阿里「欢乐马」正式上线,抢先实测这匹「黑马」

4月27日,阿里ATH团队上线视频生成模型HappyHorse 1.0。它依托多模态架构,音视频创作编辑一体,价格实惠。支持文生、图生、多图参考生视频,视频编辑功能强大,能精准替换主体、添加元素、改变风格。

机器之心
算法论文8

几分钟扫完细菌全基因组,MIT团队用AI找出大量未知的抗病毒防御系统

MIT科学家开发AI模型DefensePredictor,能从细菌基因组快速找防御系统。用约1.7万个细菌基因组训练,借助ESM2蛋白语言模型,几分钟扫描完一个细菌全基因组,还开源供科学界使用,潜力巨大。

DeepTech深科技
开源动态8

完全透明开源的共情语音大模型,三阶段训练,四大模块实现端到端对话 | 紫东太初联合长城汽车开源OpenS2S

GPT - 4o、Gemini等顶级语音模型闭源,紫东太初团队联合长城汽车AI Lab开源端到端共情语音语言大模型OpenS2S,提供构建共情语音系统新范式,开源所有核心资源,还介绍了技术方案、数据构建及训练流程等。

量子位
新闻资讯7

DeepSeek V3.1 突发离谱「极」字Bug的原因找到了~

DeepSeek V3.1被曝恶意漏洞,生成文本时会突然插入“极”字。该漏洞在第三方API平台和官方Playground均有出现,可能因数据集“污染”或模型“偷懒”,严重影响高精度场景。

PaperAgent
产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
算法论文8

何恺明团队重磅新作:去掉VAE,无需Tokenizer,纯Transformer预测数据比预测噪声更高效

麻省理工学院何恺明团队发布颠覆性研究,指出主流扩散生成模型未做好去噪工作,回归洁净数据预测才是高维像素生成正解。团队设计实验验证观点,提出极简架构JiT,展现优越性能与扩展能力。

AIGC开放社区
开源动态8

通用的dLLM开发框架,让BERT掌握扩散式对话

扩散式语言模型(DLM)因缺乏易用框架和训练成本高受限。伯克利与UIUC团队基于dLLM框架,让BERT学会对话,证明‘离散扩散 + 轻量级指令微调’可赋予BERT强生成能力,还开源全流程代码。

机器之心