「多模态理解」共找到 1546 篇相关文章
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。
Claude Code创始人内部分享:10个实战技巧
Claude Code创始人Boris Cherny公开团队使用该AI编程工具的完整经验,涵盖并行处理、计划模式等10个实战技巧,还指出理解思想、找到适合自己的工作流程更关键。
刚刚,全球AI生图新王诞生!腾讯混元图像3.0登顶了
LMArena竞技场发布文生图榜单,腾讯混元图像3.0夺冠,超越谷歌、字节和OpenAI等模型。它是原生多模态模型,语义理解强,核心技术独特,经多阶段训练,效果能与顶尖模型媲美。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死
Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。
MIT给微型机器人做了颗芯片,功耗仅6毫瓦,能实时3D建图
麻省理工学院研究团队开发出名为 Gleanmer 的微型芯片,功耗仅 6 毫瓦,能实时生成三维占据地图。它解决了机器人导航核心问题,通过多项优化提升性能,或让小设备拥有空间理解能力。
产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路
InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。
「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型
谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现多轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。
深度拆解,硬核解构,揭开vLLM推理系统实现高效吞吐的秘籍
文章深度拆解 vLLM 推理系统,介绍其核心组件和高级特性,包括推理引擎流程、调度机制、高级功能等,还提及系统扩展、分布式部署、性能测量等内容,助力读者理解推理引擎工作原理。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。