「多模态统一模型」共找到 8218 篇相关文章
快手Klear团队提出CE-GPPO:通过梯度保留协调熵,解决强化学习中的熵不稳定问题
快手 Klear 语言大模型团队提出新强化学习算法 CE - GPPO,以「熵」为核心,提出梯度保留策略,重新利用裁剪外区间低概率 token 的梯度,实现策略熵的精细调控,解决强化学习中熵不稳定问题。
又来了!OpenAI 发布 Sora 2,同时推出 AI 版Tiktok
9月30日,OpenAI发布新一代视频生成模型Sora 2,相比Sora 1有显著提升。同时推出iOS社交应用Sora,类似TikTok。应用有安全措施,已在美加iOS平台邀测。社区反应两极分化,OpenAI野心大但或面临挑战。
震撼!AI物理「双修」:亥姆霍兹方程嵌进生成器,伪影当场消失
抢滩6G前夜,香港科技大学(广州)等机构发布PhyRMDM框架,将物理约束与生成模型能力融合,解决传统AI构建无线电地图预测失真问题,成果被顶会ACM MM 2025接收,代码和权重已开源。
Prompt的尽头,居然是MBTI。
文章介绍了用MBTI人格优化大模型对话的技巧。论文《心理学增强AI智能体》证明给AI一个MBTI人格很有用,不同人格AI处理任务表现各异,还能组建性格互补的AI团队完成不同工作。
阿里开源AgentScope 1.0,多智能体从开发到部署一条龙服务
大语言模型发展下,多智能体系统开发面临诸多难题。阿里通义实验室开源AgentScope 1.0框架,以开发者为核心,有三层解耦架构,模块化设计,还解决安全和管理问题,在工程化特性上优势明显。
人形机器人终于学会洗碗了
Figure机器人学会洗碗,用的是叠毛巾和分包裹同款Helix架构,无新算法和特殊工程,仅增加新数据。该架构是端到端“视觉 - 语言 - 动作”模型,同一系统增数据就能学新技能。
Github 4.1k star,SuperSonic AI×BI 大厂震撼开源
SuperSonic 是腾讯音乐开源的下一代 AI+BI 平台,融合 Chat BI 与 Headless BI 两种范式。它解决了传统 BI 工具复杂、数据口径不统一等痛点,有丰富功能和技术优势,适用于多业务场景,开源优势明显。
谷歌大脑之父首次坦白!茶水间闲聊引爆万亿帝国,AI自我突破触及门槛
AI界传奇Jeff Dean在「登月播客」深度访谈中,回顾个人成长、Google Brain早期故事及AI未来思考。他揭秘诸多细节,还谈到神经网络发展、注意力机制突破、LLM可解释性等内容,也提及未来五年规划。
一文读懂:GPU到底是怎么工作的?
文章详细介绍GPU工作原理,对比其与CPU差异。指出GPU擅并行计算、能解决复杂问题,还分析FLOPS、延迟、内存等因素对性能的影响,最后讲了GPU通过多线程和超量订阅获高吞吐量。
智算浪潮下的专有云操作系统安全:范式跃迁与信任链重塑
云计算发展使专有云成企业平衡便利与安全之选,但 AI 冲击其安全范式。阿里云三位专家探讨 AI 时代专有云安全,涉及物理隔离价值、新技术重塑安全逻辑、国产 OS 与芯片协同挑战等,还介绍阿里云方案及未来趋势。