「双模式架构」共找到 2410 篇相关文章
IROS 2025 | 机器人衣物折叠新范式,NUS邵林团队用MetaFold解耦轨迹与动作
新加坡国立大学邵林团队提出MetaFold框架用于机器人衣物折叠。它创新分层架构,解耦任务规划与动作预测。构建开源数据集,经实验在多指标超现有方法,还验证了从仿真到现实的迁移能力。
社区供稿 | 开源多模态大模型新突破,书生·万象3.5发布,通用能力、推理能力与部署效率全面升级
2025年8月26日上海AI实验室开源发布书生·万象InternVL3.5,通过创新技术实现推理、部署和通用能力全面升级。它有多种尺寸模型,多项性能领先,还加强了智能体核心能力,应用场景广泛。
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
The Batch: 868 | AI 视频走向主流
生成式视频席卷网络爆款、广告宣传,甚至登陆 Netflix 剧集。如 Dor Brothers 用 AI 打造爆款视频,Genre.ai 低成本制作广告。各主体制作方式有别,顶尖模型开发商也积极与影视方合作,AI 正改变影视业。
从BERT到T5再到Qwen3:关于Embedding的八点总结
哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。
The Batch: 862 | OpenAI 的重新"开放"
OpenAI 发布自 2019 年 GPT - 2 以来首个开源权重模型 gpt - oss 系列,含 gpt - oss - 120b 和 gpt - oss - 20b,为智能体应用设计,免费使用修改。介绍其输入输出、架构等,还对比了性能表现。
扣子要做 Agent 时代的 Infra,附开源版搭建全流程
扣子宣布开源 Coze Studio,后端用 Golang,前端用 React 和 TypeScript,基于微服务架构。借助火山引擎 ECS 可一键部署,还能更换自定义模型。官方表示开源是为顺应趋势、确保安全及获开发者反馈。
马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?
马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。
“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷
上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。
爆肝一周看6小时长视频,解读AI时代程序员价值几何
作者花一周看完Lex Fridman对丹麦传奇程序员DHH的6小时访谈。DHH分享编程经历,谈对流行技术看法,认为AI不能取代人类创造力,还谈及创业、开源等观点,展现深刻认知与独特态度。