「实时生成技术」共找到 4892 篇相关文章
阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。
谷歌Ironwood架构TPU v7:用AI造AI,撼动英伟达芯片帝国
11月25日谷歌云发布第七代定制芯片Ironwood,由AlphaChip设计。它以9.6 Tb/s光互联带宽和1.77 PB共享显存池重构大模型推理硬件基准,挑战英伟达芯片地位,展现AI算力竞争新趋势。
英伟达Run:ai没做到的,被华为开源方案实现了
传统存储难满足AI需求,存储需向‘智能存储’演进。华为数据存储团队推出系列产品和开源工具链,其Flex:ai对标Run:ai,更开源底层,能解决行业算力痛点,已在医院场景落地。
LLM 没意思,小扎决策太拉垮,图灵奖大佬 LeCun 离职做 AMI
图灵奖得主 Yann LeCun 宣布年底从 Meta 离职创业,聚焦高级机器智能研究项目 AMI。他离职是因与 Meta 在 AI 发展路线上冲突,且不满 LLM,坚持基于“世界模型”的下一代 AI 技术。
210亿美元的幻觉?奥特曼投了一家核能初创
AI热潮下,Oklo核能初创靠概念市值达210亿美元,投资人是奥特曼;而从SpaceX离职的工程师创立Quilter,让AI画电路板,几分钟完成工程师三天工作,二者代表造梦与造物两种姿态。
从好莱坞特效到AI芯片的十年之约:SIGGRAPH Asia 2025登陆香港!
2025年12月15 - 18日,SIGGRAPH Asia将在香港举办。相比2014年深圳会议,中国图形领域已从跟跑变引领。此次会议亮点多,能展示中国技术突破,还为从业者提供交流合作机会。
硅谷热议:最快语音转文字模型
AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。
Zero-RAG,对冗余知识说“不”
文章指出大语言模型知识冗余,RAG 检索效率低。复旦大学邱锡鹏提出 Zero - RAG,能精准识别并剪除冗余知识,砍 30%语料准确率掉点小,检索延迟降 22%,还介绍了其技术方案。
谷歌Nano Banana 2 来了,图片AGI提前到来?
伴随Gemini 3、GPT 5.1小道消息,谷歌Nano Banana 2提前到来。它采用多步骤生成流程,有自我纠错循环,能替代部分Photoshop功能,在细节、配色等方面比一代提升明显,即将正式上线。
颤抖吧,Bug!OpenAI放出GPT-5「夜行神兽」,命中92%漏洞
OpenAI推出用GPT - 5找修安全漏洞的智能体Aardvark,处beta测试阶段。它开创‘防御者优先’范式,实战识别漏洞率达92%,能强化安全体系。其工作原理独特,与传统技术不同。