全感交互系统」共找到 3799 篇相关文章

开源动态8

张雪机车燃爆封神!国产2B语音模型重磅开源,网听完都起鸡皮疙瘩

面壁智能联合多方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供家桶级工具箱,采用独特技术路线。

新智元
算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
产品应用8

Agent、图像、视频是大版本升级:春晚还没开,豆包AI就火了

2026年AI市场竞争激烈,海外公司密集发布新模型致华尔街震动。国内腾讯、阿里、字节参战,字节官宣豆包参与春晚互动。2月14日火山引擎宣布豆包系列模型面升级,含大模型2.0、图像模型Seedream 5.0 Lite、视频模型Seedance 2.0。

机器之心
推荐文章7

我收集了 12 条技术社区疯传的 Claude Prompt,如今这篇帖子火遍

近日一篇关于Claude提示词的整理帖在海外技术社区走红。发帖者汇总了‘被反复验证有效’的Claude Prompt,清单中的提示聚焦质疑、拆解等认知工作,InfoQ翻译整理了12条供参考。

InfoQ
新闻资讯7

GPT-5.3爆更前夜,网都被一张图吓到!ChatGPT人格大赏

OpenAI华人研究员Joanne Jang一条推文引发ChatGPT生图玩法热潮,它能根据聊天记录生成反映‘待遇’的自画像。近期ChatGPT记忆功能优化,已向球Pro和Plus用户推出。还有爆料称GPT - 5.3要来了。

新智元
算法论文8

TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法

北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。

机器之心
开源动态8

5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆免费!

今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。

开源星探
算法论文8

北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统

现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。

AI科技评论
新闻资讯7

网破防,AI「手指难题」翻车逼疯人类!6根手指,暴露Transformer致命缺陷

最近网友被AI「手指难题」逼疯,给AI六指手,它始终无法数对。GPT - 5.2、Nano Banana Pro等均翻车。此问题揭露当前模型思考机械、割裂等缺陷,也凸显Transformer架构弱点。

新智元
产品应用8

Nano Banana Pro最解析,设计师和开发者都用得上,附官方提示指南

Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理能力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间。

AIGC开放社区