端到端生成」共找到 4146 篇相关文章

产品应用8

AI圈再颠覆!中国AI翻译耳机通话翻译,实测震撼

科大讯飞发布全新AI翻译耳机,上海与迪拜连线对话实测表现震撼,响应延迟低至两秒。其集成“语音同传”技术,采用“骨导+气导”设计。此外,翻译机2.0也升级,科大讯飞在AI翻译领域优势显著。

新智元
产品应用8

新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!

2025 年被称为“Agent 元年”,月之暗面发布了强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。

特工宇宙
产品应用7

真香!我用AI做PPT的血泪史:从“能用”“真香”,V3版底解决了什么?

作者因公开分享需做PPT,尝试多种AI PPT工具后,自己围绕Agent攒了一个。从V1V3版不断改进,V3用多Agent提示词用法,风格多样且规则减少,还给出3步制作PPT的方法及后续功能拓展想法。

AI 产品自由
开源动态8

【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化

这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,推理2.7倍加速。

GiantPandaLLM
推荐文章8

多模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区
开源动态7

李飞飞空间智能独角兽开源底层技术!AI生成3D世界在所有设备流畅运行空间智能的“着色器”来了

李飞飞创立的World Labs开源核心技术Forge渲染器,可在各设备实时、流畅渲染AI生成的3D世界。它是Web3D高斯泼溅渲染器,地位似传统3D领域“着色器”,还解决了3DGS渲染难题。

量子位
产品应用8

字节Lynx:从单张图像生成高保真个性化视频

字节推出高保真个性化视频生成框架Lynx,基于开源的Diffusion Transformer,引入ID - adapter和Ref - adapter,在基准数据集表现优异,能平衡身份保真度等,还可拓展至多模态和多主体。

带你学AI
算法论文8

CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代

中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于预训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。

机器之心
算法论文8

AI自动写学术综述:10分钟生成6万字,成本不四块钱

上海人工智能实验室等单位提出SurveyForge框架,能自动化生成高质量学术综述论文。它有双数据库协同驱动的大纲生成机制、学者导航代理SANA和并行生成与协调机制。还有SurveyBench评估框架,实验显示其效果好,应用前景广。

量子位
新闻资讯7

全国首部“AI生成内容合规”标准,现公开征集起草单位和个人

随着AIGC转向产业落地,监管对生成内容管控成趋势。全国首个AI生成内容合规团体标准《人工智能生成内容合规管理指南》应运而生,它规范合规要求,还提供四大核心路径解决企业痛点,现征集起草单位和个人。

AI工程化