「交互门槛」共找到 1068 篇相关文章
真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」
谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时长和使用门槛限制,但已足够震撼。
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。
用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」
新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。
2亿多人开始和AI打电话,他们在聊什么?
2025年12月豆包月活达2.27亿,越来越多人与它语音通话。此前AI语音交互存在问题,豆包升级为全双工模型,体验更像打电话。作者实测其在不同场景表现出色,还分享使用技巧,并对比了和ChatGPT语音的优劣。
发生在CES的六场对话:来自深圳的 AI 硬件“外卷”
2026年CES上,中国硬件力量涌向全球。虽有地缘政治摩擦、签证障碍,但全球市场仍看好中国AI硬件。大厂将边缘硬件定义为AI生态入口,初创公司从数据、场景、交互寻生存之道,机器人应用场景也更明确。
7 小时连续重构不掉线!一骑绝尘的Claude 终于遇到对手:Greg Brockman亲自解读AI编程重大突破
9月16日,OpenAI推出新模型GPT-5-Codex,专为AI辅助编程工具设计。它在代理编码基准测试中表现佳,形成了覆盖各种需求的交互界面,还具有更优的后训练特性,能连续工作7小时完成复杂重构。
清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发
大语言模型存在“知识截止”问题,RAG技术应运而生,成为大模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。
开源的 V0/Lovable 替代方案Libra AI
Libra AI是面向生产环境的AI原生开发平台,可通过自然语言交互管理Web应用全生命周期。它功能丰富,如AI智能编码、集成开发体验等。其开源有技术自主、架构灵活等好处,还介绍了技术架构、上手方式与部署方案。
比RAG高出8.9%,百度TURA:让搜索引擎“动”起来的下一代AI Agent架构
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户需实时数据的问题。百度TURA用工具调用把RAG升级为动态交互,其核心分检索、规划、执行三步,已在百度亿级流量场景跑通。
VLA爆发!从美国RT-2到中国FiS-VLA,机器人「即知即行」的终极进化
2025年具身智能爆火,VLA模型成核心。从美国RT - 2到中国FiS - VLA,VLA硬核进化。谷歌、微软等有重要成果,中国智平方等企业也不断创新,FiS - VLA性能超现有方法,VLA正重塑机器人与人类交互未来。