「多模态语音理解大模型」共找到 1766 篇相关文章
AI 美妆 ARR 一年增 14 倍达 5500 万美金;另一 Newsletter 阅读 App 融了 600 万美金
海外创业者做的 Newsletter 聚合阅读 App Perch 融 600 万美金,可聚合内容,有语音朗读和 AI 摘要功能,还有类似 X 的推荐机制。同时,AI 美妆产品一年 ARR 增 14 倍达 5500 万美金。
从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件
AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。
Agentic UI:重新定义“好体验”——不是美化按钮,而是让认知负担归零
随着 AI 从“辅助者”变为“执行者”,前端架构需重新定义。传统 UI 以“人是执行主体”为假设,已成为释放 Agent 执行能力的障碍。文章提出 Agentic UI 应成为数字员工的执行工作台,介绍了构建方法及试验成果。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。
AAAI 2026 | 革新电影配音工业流程:AI首次学会「导演-演员」配音协作模式
现有AI配音缺“人情味”,因跳过“导戏”“揣摩”环节。内蒙古大学刘瑞教授团队在AAAI 2026提出Authentic - Dubber框架,模拟真实配音流程,实验显示其情感表达优势明显,提升了AI配音竞争维度。
腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」
腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。
均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事
当强化学习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。
AI驱动的卡片笔记项目
Blinko是AI驱动的卡片笔记项目,方便快速捕捉和组织灵感。有AI增强笔记检索、数据所有权保障等特性,支持多平台,还具备离线语音识别功能,支持多种AI模型,是开源项目。
突发!OpenAI深夜推出浏览器ChatGPT Atlas:一文深度详细解析「率先支持mac OS」
OpenAI推出人工智能驱动的浏览器ChatGPT Atlas,集成对话式AI改变上网方式。它有随行聊天、浏览器记忆、代理模式三大核心功能,面向全球macOS用户上线,更高级功能对付费用户开放,还注重安全与用户控制。