「豆包语音团队」共找到 3743 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
用嘴聊出来了一个 APP:实测「码上飞」语音开发有多离谱
本文实测「码上飞」AI 开发平台,它让用户用对话或语音描述需求,AI 就能做出应用。测试了美甲预约、AI 生图、私域自媒体知识付费小程序三个场景,它表现出色,大幅压缩开发成本,助普通人跨过技术门槛。
刚刚,豆包编程模型来了,我们用四个关卡考了考它!
2025年AI编程助手分化为IDE增强和Agentic两条路线。当前Claude Pro有使用限制,火山引擎推出豆包编程模型Doubao-Seed-Code。它在多项评测表现优异,具备长上下文等能力,经四关测试实力强,价格也实惠,或成完美平替。
Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品
尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。
社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界
微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。
西工大张伟伟团队:大模型时代航空科技的蓝图畅想 | 航空学报CJA
随着国产开源大模型涌现,大语言模型走入生活,挑战传统航空教育,革新科研范式,与航空产业融合推动变革。西工大张伟伟团队探讨其在航空工程教育、科研、行业全链条的影响及挑战。
ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架
北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。