「语音生成」共找到 2422 篇相关文章
AI 美妆 ARR 一年增 14 倍达 5500 万美金;另一 Newsletter 阅读 App 融了 600 万美金
海外创业者做的 Newsletter 聚合阅读 App Perch 融 600 万美金,可聚合内容,有语音朗读和 AI 摘要功能,还有类似 X 的推荐机制。同时,AI 美妆产品一年 ARR 增 14 倍达 5500 万美金。
上交大 × 华为小艺推出LoPA:7B扩散语言模型单样例1000+ tokens/s!
上海交通大学DENG Lab联合华为小艺团队提出无需训练的解码算法LoPA,配合自研的LoPA - Dist分布式推理系统,显著提升扩散大语言模型(dLLMs)的推理并行度和吞吐量,将推理效率推向新高度。
官宣!前 OpenAI 华人科学家姚顺雨加入腾讯,大模型“系统战”开启!
12月17日消息,前OpenAI科学家姚顺雨加盟腾讯,任首席AI科学家等职。他是AI Agent与大模型推理领军人物,其加入是腾讯AI补强。腾讯还新成立三部门,标志战略向系统化工程建设进阶,混元也有不错表现。
视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%
加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。
新玩法!Karpathy周末手搓“大模型智囊团”应用:各大LLM同台互评,代码已开源
Andrej Karpathy周末手搓Web应用llm - council,让多个大模型像顾问般提供建议。查询通过OpenRouter分发给多个大模型,它们互评后由‘大模型主席’生成最终回复,代码已开源。
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
李飞飞最新长文:AI的下一个十年——构建真正具备空间智能的机器
李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》,解读空间智能,阐述构建具备空间智能机器的核心框架,探讨其应用场景,认为这是AI下一个前沿。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
刚刚,英伟达拟10亿美元砸向这家AI编码创企!Copilot 技术大佬带队、成立两年估值近千亿
10月30日消息,英伟达拟向AI初创公司Poolside投资最高10亿美元。该公司由微软技术大佬带队,定位生成式AI与软件开发交叉领域,开发自研模型,有独特强化学习方法和技术布局。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。