语音操控」共找到 354 篇相关文章

产品应用8

锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验

LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。

新智元
算法论文8

一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人

澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将长文档转为带语音和同步幻灯片的视频,流程可控且适应多领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。

新智元
算法论文8

VLA统一架构新突破:自回归世界模型引领具身智能

北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。

机器之心
产品应用7

从零开始,教你用Codex搓出属于你自己的第一个硬件。

作者分享用Codex开发久坐提醒猫爪硬件的过程。先与Codex聊需求、写代码,再按其提供的清单买硬件,连线、烧录也靠它指导,还可让它调试动作、操控3D打印,体现AI时代硬件开发的便捷。

数字生命卡兹克
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。

花叔
产品应用7

老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍

Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。

新智元
新闻资讯8

13年死磕一个真理,这家中国AI黑马冲刺IPO

云知声深耕AI 13年,即将冲刺港交所IPO。它从单一语音识别发展为全栈AGI方案商,以智慧生活和智能医疗双轮驱动,营收稳健增长。其坚持技术创新,构建全栈自研体系,有望在AI时代持续领跑。

新智元
新闻资讯7

AI硬件闭门探讨:未来硬件只是数据的入口,接下来是「软件定义硬件」的时代

文章围绕AI硬件展开探讨,介绍了如Plaud录音卡片、智能眼镜等产品现状。指出多数用户对当下AI硬件不满,市场尚处早期。分析不同产品成功因素、竞争压力,还提及情感陪伴类产品问题,强调未来是「软件定义硬件」时代。

Founder Park
产品应用8

智谱AutoGLM上线:给每个手机都装上通用Agent,AI从"对话"走向"操作"的里程碑

智谱AI上线AutoGLM,这是全球首个手机通用Agent,能让AI操作手机完成复杂任务。其技术架构强大,在多方面表现优异,与其他AI助手相比优势明显,还推出情感语音模型GLM - 4 - Voice,正推动大模型落地AI手机。

AIGC开放社区
产品应用8

WPS没有忘记WPS|甲子光年

在世界人工智能大会上,多家企业推出AI PPT类产品,但大多只能生成,不会使用PPT。金山办公发布WPS AI 3.0版本——WPS灵犀,它是原生Office办公智能体,能像人一样使用办公软件,还带来灵犀语音助手和WPS知识库。

甲子光年