「多模态处理能力」共找到 4444 篇相关文章
蚂蚁出手VLA,就是开源超越Pi0.5的基座模型
当前具身智能落地面临泛化能力不足的挑战,蚂蚁灵波开源发布的基座模型 LingBot-VLA 带来突破。它基于大量真实世界数据预训练,在多项真机任务测试中超越 Pi0.5,且在架构、效率等方面有创新。
System 3 觉醒:从“工具”到“物种”的根本改变
西湖大学与上海交大新论文提出System 3概念及Sophia框架,将认知心理学概念映射到代码模块,让AI Agent像“生命体”生存。采用前向学习和混合奖励机制,实验显示其能力显著进化,为人工生命指明道路。
PixelRefer :让AI从“看大图”走向“看懂每个对象”
多模态大模型多停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在多项任务表现领先,轻量版性能优,还开源两类数据集。
首个国产开源AI原生后端,不再写后端,AI就是全栈工程师。
Aipexbase是首个国产开源AI原生后端即服务平台,能在AI辅助下完成前后端一体化开发。开发者无需编写后端代码,通过前端SDK或MCP一键调用后端能力,适配国内生态,定义了AI原生开发新模式。
OceanBase全面拥抱AI新进展:OB Cloud支持十亿级多类型向量数据,数十家企业实现AI应用落地
大模型热潮下,企业面临AI落地难题。OceanBase的OB Cloud支持十亿级多类型向量数据,已有数十家企业实现AI应用落地。它具备多云原生、AI能力优势,提供一体化架构和多模向量一体化,还降低了AI应用门槛。
Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
现在3行配置就能让GPT - 5.6 Sol封印解除,在Codex里用上1M上下文。不过有网友警告轻易别用,因超出默认窗口,模型消耗token速度会翻倍,且模型上下文利用能力会下降。此外,Codex确定会上Astra。
11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI
过去两年,AI 生成图片、视频变得容易,但让 AI 理解并按创作者意图创作很难。美图影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。
BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026
BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。
Karpathy用「harness」彻底终结了RAG。
假期时Karpathy提出llm.wiki想法引发关注。它是元框架,定义人类与AI协作管理知识的方式。与RAG不同,它将新材料关键信息编入已有wiki并持续维护。作者用多种数据测试,发现TextIn API解析效果好,还优化处理流程提升质量。
4天100万下载,这个移动端Agent直接给谷歌偷家了。
蚂蚁的全模态助手灵光爆火,上线4天下载量达100万,三天冲上App Store总榜第六。它提前实现了谷歌AI Studio移动版的核心能力,以简洁报告输出和多智能体协作架构获市场认可,有望让创造力平权。