「AI语音输入」共找到 9962 篇相关文章
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!
Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。
一键搞定双语播客的项目,效率+200%,太6了!
文章介绍开源项目Twocast,它是AI播客生成器,能模拟双人自然对话,3分钟产出一期播客。有双人对话、多输入、多语言等特色,提供两种安装方式,适合多类人群。
马斯克彻底向ASI投降!10年后万亿财富都将「归0」
2026年7月23日,马斯克接受《经济学人》总编专访,给出AI发展时间线,称5年内AI智力超人类总和,10年内金钱无意义。他曾是AI末日论者,如今态度转变,还提出AI安全治理方案。
“千问奶茶”在二手平台6元转售;追觅俞浩:年终奖最高20个月奖金,总量会达到10亿级;京东001号快递员:退休金4000多,存款百万|AI周报
这是一份AI周报,涵盖行业热点、大模型发布等多方面信息。有追觅俞浩高额年终奖计划,马云现身阿里千问项目组引发‘千问奶茶’活动热潮,还有域名交易、企业收购、模型发布及应用等动态。
深度拆解 Gemini 3.8 Live:一句插话,为什么会牵动整个 Agent 系统
本文深度拆解Google发布的Gemini 3.8 Live,分析其将语音、推理、工具调用整合进持续运行链路的架构创新,探讨Voice Agent进入Runtime阶段的核心技术挑战与未来AI Agent发展趋势。
Anthropic一夜震撼升级:Claude获得「永久记忆」!全球打工人变天
消息人士爆料Anthropic给Claude Cowork重磅升级,知识库注入永久记忆,Cowork模式与Chat模式合并成默认界面。还有UI、自动化、语音等多方面升级,若落地Claude将成生产力搭子,或引发AI办公革命。
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
谷歌深夜双发!最便宜Nano Banana来了
谷歌深夜上线Nano Banana 2 Lite和Gemini Omni Flash。前者是最快最便宜文生图模型,4秒生图且成本低;后者是视频生成模型,支持多模态输入和对话式编辑。二者串联打通创作流水线,还集成SynthID水印技术。
华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」
IJCAI 2026将召开,AI算力成本高,参数扩张边际收益低,技术创新逻辑转向‘用得更省’。华为四篇被收录论文,用精巧架构和训练策略,在四方向展现系统化工程能力,提供技术转型路径。