语言交互」共找到 1667 篇相关文章

产品应用8

马斯克AI女友直播「一秒变身」,Karpathy看完立刻投钱

世界首个支持直播推流的「实时」扩散AI视频模型MirageLSD诞生,大神Karpathy亲自站台。它能理解真实视频后同步生成AI视频,实现零延迟、无限时长、每秒24帧不卡顿,给视频娱乐和直播互动带来丰富想象。

新智元
新闻资讯8

Gemini负责人爆料!多模态统一token表示,视觉至关重要

Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

量子位
开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
推荐文章8

巨头博弈下,Agent 的机会和价值究竟在哪里?

极客公园创始人与拾象相关人员对话,探讨 Agent 热点话题。指出其真正门槛或在基础设施,还谈及产品路径、技术挑战等,如通用 Agent 是大模型公司主战场,Coding 是衡量 AGI 关键指标等。

海外独角兽
新闻资讯7

The Batch:833 | 针对智能体的钓鱼攻击

研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。

DeeplearningAI
算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。

机器之心
算法论文8

一个md文件收获超400 star,这份综述分四大范式全面解析了3D场景生成

南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法分四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。

机器之心
新闻资讯7

马斯克的xAI以1130亿美元估值,出售3亿美元股权

金融时报消息,马斯克旗下xAI正以1130亿美元估值出售3亿美元股权,细节未全披露。若融资成功,其估值将跻身全球前列。xAI成立于2023年,获巨额融资,与X合并,产品Grok AI功能丰富。

AIGC开放社区
产品应用8

大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一

传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。

机器之心
推荐文章8

提示工程实战指南:从Zero-Shot到Graph Prompting,7大核心技术全解析

随着大型语言模型发展,提示工程成关键技能。文章介绍零样本提示、少样本提示等七种提示优化模式,分析适用场景、优缺点,还给出示例,最后总结各技术适用场景及最佳实践。

OpenMMLab