「语言交流」共找到 1234 篇相关文章
ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流
大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。
ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」
随着多模态和大语言模型发展,人类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。
抢疯了!AI宠物翻译器:800多块,预售2万单
PettiChat宠物翻译器售价800多,预售2万单。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。
CNCF 警告:仅靠 Kubernetes 不足以保障 LLM 工作负载的安全性
云原生计算基金会(CNCF)指出,企业在 Kubernetes 上部署大语言模型(LLM)存在安全缺口。Kubernetes 无法理解或控制 AI 系统行为,需增加额外控制层,引入 AI 特定控制。
豆包,即将杀死比赛
本文讲述作者在不同场景的经历,展现豆包在大众心中的高认知度。还提及豆包用户规模领先、被业内人士使用、成内容创作热点等,且将深度嵌入春晚,或强化“AI = 豆包”印象。
GitHub告诉你,开发者真正需要的AI是什么
GitHub高级产品经理与开发者布道师交流发现,开发者想要更顺畅、少打断的创造过程。优秀AI编码工具应守护专注力、减少对话框干扰、赋予开发者掌控权,适应不同阶段开发者需求。
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA
多模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。
突发!OpenAI大神姚顺雨,任腾讯首席AI科学家
OpenAI科学家姚顺雨入职腾讯,任首席AI科学家,兼AI Infra部、大语言模型部负责人。他是清华姚班学霸,研究智能体成果多,还曾提出AI进入‘下半场’,评测将更重要的观点。
谷歌重磅开源 A2UI,这将会是2026年Agentic UI的王炸级标准!
过去人和AI交互多靠文本框和语音,实际应用中存在问题。谷歌开源A2UI,是AI Agent和用户界面的中间层协议,核心是声明式JSON和客户端原生渲染,有多种能力,还给出快速入手步骤。