「人机交互范式」共找到 1689 篇相关文章
小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源
小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。
Rokid火得太晚了
消费电子市场中AI眼镜迎曙光,乐奇Rokid成AI+AR品类全球销冠。它通过双目衍射光波导和双芯片架构解决轻量化与续航难题,还以开放生态脱颖而出,其判断未来眼镜将成交互主体。
The Sentient Interface: Art, Technology, and the Expanded Mind
在计算与数据主导的时代,艺术、科学与技术边界渐趋模糊。本次活动汇聚四位从业者,探讨如何将无形元素转化为审美体验,从生态数据到AI叙事,跨越学科探索人机关系与环境依存。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
麻省理工AI放王炸!无需说话、秒懂你的想法,外挂AI大脑来了
今天凌晨2点,麻省理工学院分享突破性研究Alterego。它是可穿戴无声语音交互AI设备,通过捕捉神经肌肉信号实现无声沟通,处理后用骨传导耳机反馈结果,应用场景广泛,还能帮助残疾人交流。
刚刚,Anthropic官方Cluade 5使用指南发布
Anthropic发布Claude 5的Context Engineering官方指南,指出为Claude Opus 5和Claude Fable 5删掉Claude Code超80%的system prompt,在编码评估上无明显损失。还揭示6组范式反转及四类上下文载体新分工。
我想给 OpenClaw 接上语音,结果有人先做了
作者一直想用语音对接 OpenClaw,却发现「光帆AI」团队已朝此方向发展。他们用 APP 跑通「耳机 + 服务」链路,后续将迁移到硬件。作者体验后觉得交互爽,还介绍了接入方法、安全模式等。
黄仁勋GTC开场:「AI-XR Scientist」来了!
英伟达CEO黄仁勋在GTC大会展示LabOS,这是全球首个融合AI与XR的协研科学家平台。它将多模态感知等技术融合,构建端到端闭环,还通过三大生物医学案例展示功能,开启人机协同科研新纪元。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。