「多模态开发」共找到 2438 篇相关文章
感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义
伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。
V4Flash 的价格、Opus4.8的能力,Ox Alpha (牛来)正式开源!
Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。
本地/云电脑双模式,豆包来了!
黄叔实测豆包「工作任务」模式,其有独特的本地/云电脑双模式。本地能分析电脑内存问题,云端可处理监控任务,还能助力开发复杂项目,且Skill自动接入,与本地电脑实时同步。
Codex 装进 iPhone 后,开发者每天多 3 小时生产力时段
5月14日,OpenAI将Codex塞进ChatGPT手机App,所有套餐包括免费版都可解锁。Codex手机版定位是AI代理遥控器,解决远程开发安全顾虑,解开“人类必须坐在电脑前”束缚,还催生新工作流。
这,才是Vibe Coding的未来。
作者分享蚂蚁灵光更新,可搓小游戏,认为这是Vibe Coding未来。普通人能用上是其亮点,还举例扫地机器人、灵光开发三国人物关系等游戏,指出技术应隐藏自己,降低门槛。
想清楚再动手:具身智能也要学会脑补未来和择优执行 | RSS 2025
近年来基础模型在具身智能领域能力惊人,但在真实部署中常‘用不好’。卡耐基梅隆大学与伯克利人工智能研究院团队提出 FOREWARN 框架,结合‘世界模型’与‘多模态语言推理’,解决部署智能难题。
深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?
昨天,Meta发布约30B参数的多模态Agent模型Muse Glimmer,支持128K级上下文。它采用Apache 2.0许可证开放,有量化版本等。其技术设计围绕显存、上下文管理等问题展开,在多方面做了取舍。
太空中的两重辐射威胁,一张薄膜就能全挡住
韩国科学技术研究院团队开发出新型复合材料,将两种纳米管组合,在单层超薄结构中实现对电磁波和中子辐射的屏蔽,为多领域提供轻量安全方案,但应用落地面临性能落差、成本等挑战。
Google Stitch神了,我做周杰伦《太阳之子》播放器,2分钟后感叹前端彻底凉了
作者用Google Stitch两分钟做出周杰伦《太阳之子》音乐播放器网站,感叹前端要凉。Stitch可根据自然语言生成高保真UI,与Firebase Studio、AI Studio形成闭环。这使前端开发门槛消失,也让Figma股价下跌并推出MCP。