「自然交互层」共找到 1001 篇相关文章
大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1
盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。
豆包上可以体验 Seedance 2.0 了,我已经试了一下。
Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。
前端开的同学,天塌啦,AI把前端开发最后一公里给补上啦,不敢相信,太夸张啦~~~
Vercel Labs 开源的 agent - browser,是面向 AI Agent 的无头浏览器自动化 CLI。它解决了 AI 前端开发缺真实浏览器验证交互的问题,适用于多场景,有诸多对 AI 友好的特性,还介绍了使用方式。
0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型
上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。
人脸机器人登上Science Robotics封面:用AI教会仿生人脸机器人「开口说话」
2026年1月15日,美国哥伦比亚大学工程学院研究登上《Science Robotics》封面,展示用AI让仿生人脸机器人“开口说话”技术。机器人经自监督学习,能将声音转自然唇动,有跨语言泛化能力,助其跨越“恐怖谷”。
没错,马斯克的二次元「女友」被雷蛇装到外设里了
CES 2026 展上,雷蛇推出 Project Ava,以 5.5 英寸 3D 全息动画呈现二次元少女等形象。它基于 AI 驱动,能感知情境、交互友好。不过其由 Grok 驱动,有“调情”风格,还存在隐私侵入争议。
挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力
香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。
最低 306KB,这款低延迟语音检测神器太绝了!
语音交互中,VAD至关重要。新开源的TEN VAD能精准识别语音起止,是替代WebRTC VAD和Silero VAD的优选。它低延迟、高准确率、极致轻量,已被Kaldi集成,还能跨平台部署,使用方便。
完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原
谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。
豆包官宣手机助手:AI 还能带来哪些新体验?
字节豆包团队官宣做手机助手,它基于操作系统层面授权,背靠豆包大模型带来交互创新。虽无自研手机计划,但正与多家厂商洽谈合作。开放体验机型是与中兴合作的nubia M153。