「多视角数据」共找到 6025 篇相关文章
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
领域驱动的 RAG:基于分布式所有权构建精准的企业知识系统
银行技术供应商为解决文档和专业知识获取难题,探索用 RAG 技术,严格将 AI 作咨询工具。重新分配 RAG 实施所有权,采用元数据方法,探索伸缩性解决办法,构建完整应用并评估性能,结果令人振奋。
8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布
字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。
强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
用Diffusion构建「AI虚拟细胞」,14项指标霸榜!Mila唐建团队破解单细胞「破坏性」测序难题
Mila唐建团队发表PerturbDiff,跳出前人认知盲区,将“细胞群体的概率分布”视为随机变量。它引入数学工具建模,让MMD内生于体系,在多项基准测试霸榜,还提供应对数据稀缺的思路。
3天霸榜GitHub Trending,这个群体智能体能预测万物
MiroFish是基于多智能体技术的AI预测引擎,可构建平行数字世界推演未来。它前身BettaFish曾爆火,作者受其启发开发此项目。文中还介绍了工作流程、部署方式及项目地址。
一天两枚“代码核弹”:OpenAI 祭出首个“主打实时协作”的 Codex 模型,谷歌放出 Gemini Deep Think,码力冲到世界前8
OpenAI 发布 GPT - 5.3 - Codex - Spark 研究预览版,专为实时编码设计,降低交互延迟。谷歌更新 Gemini 3 Deep Think,面向科研与工程难题,在多领域测试表现出色,二者引发网友热议。
你聊得很开心的AI女友,背后却是被当做耗材的肯尼亚小伙们。
肯尼亚小伙迈克尔应聘工作后,成了伪装AI的陪聊员。工作严苛,还得忍受不适内容。公司借此收集数据训练算法,他越努力就越快被替代,成了AI时代的‘耗材’。
Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型
Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。
Meta通过简单算术解锁LLM SoTA性能
大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。