语音输入」共找到 471 篇相关文章

开源动态8

腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容

腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。

量子位
开源动态8

“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!

7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。

AI前线
开源动态8

2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
算法论文8

推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品

在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。

量子位
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

量子位
推荐文章7

Claude Code没有“魔法”

资深工程师 Daisy Hollman 在演讲介绍了 Claude Code 插件设计与上下文工程原语,以及 Anthropic 内部多 Agent 工作流。指出定制模型可放大能力,上下文窗口是关键,还探讨多种插件抽象与工作流扩展方式。

InfoQ
新闻资讯7

谷歌放的这波免费AI额度,大到很多人以为是假的

谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。

AI工程化
新闻资讯8

4.3亿听障人士的福音,哥大团队研发脑控助听器,最高增益12分贝

哥伦比亚大学等机构团队研发实时闭环脑控听力系统,发表于Nature Neuroscience。该系统解码大脑注意力信号,放大目标人声、压制杂音,打破传统助听器瓶颈。经多项测试,效果显著,临床应用潜力大。

DeepTech深科技
新闻资讯7

Cloudflare 构建了面向 LLM 的高性能基础设施

Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。

InfoQ
算法论文8

将注意力旋转 90 度!今天,Kimi 的「注意力残差」火了

Kimi团队发布技术报告Attention Residuals,用依赖输入的注意力机制取代标准深度递归,解决传统残差连接的信息稀释和隐藏状态爆炸问题。实验显示其有计算优势,下游任务表现佳。

机器之心