「多语言混用」共找到 4801 篇相关文章
AI「解码」古罗马,重现千年铭文真相!DeepMind新模型再登Nature
借助DeepMind推出的生成式AI工具Aeneas,考古学家面对古代碑文不再抓瞎。它是多模态生成式神经网络,能助历史学家解读、归属和修复残缺文本,还可适应其他古代语言、文字和媒介。
AI驱动的卡片笔记项目
Blinko是AI驱动的卡片笔记项目,方便快速捕捉和组织灵感。有AI增强笔记检索、数据所有权保障等特性,支持多平台,还具备离线语音识别功能,支持多种AI模型,是开源项目。
首个多人对话视频生成框架MultiTalk,角色有表情还能互动
现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。
从 AI Agent、RLHF 到 MoE 大规模训练:AMD 这场开发者日,把一线实战话题凑齐了 |Q推荐
AMD AI开发者日揭晓八大硬核GPU Workshop、技术专题及“作品说话”主题分论坛嘉宾与话题,覆盖AI Agent、RLHF、MoE大规模训练等前沿领域,还有多场实操分享。
2025云栖大会即将开幕,InfoQ 和你一起深度打卡!
9月24 - 26日,2025云栖大会将在杭州开幕,主题为‘云智一体·碳硅共生’。大会展示Agentic AI和Physical AI突破,探讨多领域话题。InfoQ与大会深度合作,全程陪伴打卡。
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
不用拍的广告片?深度拆解美团闪购AIGC营销新案例
美团闪购与AI达人共创两支AIGC营销视频,以“技术为品牌说话”。“西游篇”突出“快”,“神话篇”展示“多”,用AI生成“超现实”场景包裹品牌价值,为行业提供营销示范。
30.9K Star牛啊!!再见了PD,不越狱也能装,支持几十种系统,苹果全设备通用!
在苹果生态运行其他系统,Parallels Desktop 收费且移动设备难装。开源工具 UTM 免费,基于 QEMU 构建,支持多架构和系统,操作界面简洁,外围设备支持强,苹果全设备通用。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
字节Seedream 4.0将全量开放!抢先评测来了,我们摸索出AI生图20种「邪修」玩法
近日,字节跳动内测豆包・图像创作模型 Seedream 4.0,支持多模态生图,核心能力显著提升。它将全量上线并开放给企业客户。实测显示其多模态融合出色,还与谷歌 Nano Banana 对比,各有优势。