「多模态生成模型」共找到 9004 篇相关文章
Vibe Coding 何必只在桌面 IDE,多端智能体协同的思考与设计
依托下一代开源 AutoDev 架构,在 AutoDev 多平台预览版中实现了 Server 与 Android 的架构一体化与协同。Vibe Coding 可按自然语言提示生成代码,现阶段能完成 80% 功能,但跨越剩下 20% 挑战需团队工程化落地。
WhisperLiveKit:本地同步实时语音转文字
实时语音转文字难题待解,现有方案各有缺陷。WhisperLiveKit项目用前沿同步语音技术解决问题,支持多语言同步翻译、实时说话人识别等,还介绍了安装、部署方式,不过效果受语言和模型等因素影响。
可口可乐又翻车了?用AI做圣诞卡车广告,观众说「没灵魂」!
2025年可口可乐用AI生成圣诞卡车广告,虽品牌方称工艺提升十倍,但观众觉得没灵魂。此前春晚吉祥物‘龙辰辰’也因疑似AI制作遭质疑。AI复制情感能力已蔓延各领域,引发对情感表达的思考。
CMAME | 香港理工大学周原野、周恺等:面向清晰几何边界工程优化的拉格朗日拓扑物理信息神经网络
近年来物理信息神经网络引入拓扑优化领域,但结果边界弥散。本文提出“拉格朗日拓扑物理信息神经网络”框架,将显式可变形基础几何体嵌入可微分物理求解器,提升了优化结果的可制造性与精度。
SGLang 优化Triton FusedMoE 的一个新技巧
蚂蚁在SGLang中提交优化PR,针对Fused Triton MoE的Down Projection kernel加入TMA优化,在DeepSeek - R1模型的H200 TP8 prefill场景下性能提升显著,还详细分析了优化背景、思路、实现细节及测试结果。
硅谷陷入了对中国的痴迷与羡慕
《纽约时报》称‘硅谷陷入对中国的痴迷与羡慕’,虽有夸张,但中国在AI、基建等领域进展显著,如通义万相2.5视频大模型。a16z风投公司表达焦虑,中美科技竞赛激烈,双方开始相互学习。
Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库
Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。
他用一生证明AI没有意识!「中文屋」提出者逝世,享年93岁
2025年9月,Anthropic团队发现AI模型出现「主体错位」现象,而同一周哲学家约翰·塞尔去世,享年93岁。他一生证明AI只会模拟理解,提出「中文屋」思想实验,如今AI似有「意识」,而他却毁于性骚扰丑闻。
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本
近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。
Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了
Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。