科学多模态大模型」共找到 8148 篇相关文章

开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。

CourseAI
新闻资讯8

AI4Science 图谱,如何颠覆10年 x 20亿美金成本的药物研发模式

文章指出AI for Science让生命科学与数字互联网融合,加速科学发现。以四象限为框架,梳理了Biology Foundation Model、AI Scientist等玩家,介绍相关模型和公司,展示其对药物研发流程的重塑。

海外独角兽
新闻资讯8

不止AlphaFold,「药界ChatGPT」横空出世!华人女投资人深度揭秘

AI初创Chai Discovery宣布分子设计模型Chai-2重构药物设计逻辑,将抗体设计成功率从0.1%提升到16%,实现零样本设计。其联创认为这是范式革命,未来药神或成提示词工程师。

新智元
新闻资讯8

谷歌用Gemini 3同时革了OpenAI和英伟达两家的命

谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。

新智元
产品应用7

Meta发布Muse Spark,MSL的首份答卷!Alexandr Wang通过了吗?

Meta发布Muse Spark,是MSL首个模型,经九个月技术栈重构,效率优先。它有原生多模态推理能力,Contemplating模式处理复杂查询,安全评估突出,产品功能升级,商业化转向明显,正逐步在Meta应用推出。

AI工程化
算法论文7

Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考

文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最后提到基于其构建的智能体。

chaofa用代码打点酱油
算法论文8

打破学科壁垒!400篇参考文献重磅综述,统一调查「人脑×Agent」记忆系统

哈工大等多机构联合发布重磅综述,打破认知神经科学与人工智能学科壁垒,统一审视人脑与 Agent 记忆系统。文中剖析记忆定义、作用、分类、存储、管理等,还提及评测、安全问题及未来多模态记忆、技能迁移方向。

机器之心
产品应用8

π0.7的泛化能力有多强?零样本纯靠口述就能用空气炸锅,演示完换个机械臂也能叠衣服

2026年4月16日,美国明星机器人AI公司Physical Intelligence发布模型π0.7。它具组合泛化能力,借助多模态提示框架,能零样本完成新任务。在空气炸锅、叠衣服等实验中表现出色,有望推动具身智能发展。

DeepTech深科技
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区