「多模态处理能力」共找到 4420 篇相关文章
刚刚,MiniMax来承包你的桌面了
2026 年 Agent 赛道竞争白热化,市场分化。国产 AI 大模型独角兽 MiniMax 1 月 20 日推出第二代智能体产品 MiniMax Agent 2.0,从产品形态和能力分布深度重构,是‘AI 原生工作台’,实测表现出色。
AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。
作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。
并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈
英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。
面向业务落地的AI产品评测体系设计与平台实现
文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。
Claude官方即将推出Chrome浏览器插件,可能....其它所有的AI浏览器插件都会死。
Claude官方即将推出Chrome浏览器插件,现正进行小范围测试。它功能强大,能在侧边栏操作页面,还能处理日程、邮件等工作。相比多数插件,它安全性高,或让仅能总结摘要的插件被淘汰。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了
个人、企业用户苦工作场景「上下文」久矣,Agent常不懂真实业务。阿里千问办公开源的「MyContext」,将分散工作数据加工成Agent可消费的上下文,处理多种难题,还将能力向组织延伸,助力Agent融入工作流。
我用MiniMax Agent开发了个带后端的全栈网站,全程0代码
2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
港科大&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!
港科大广州联合北京人形创新中心推出LOVON框架,融合大语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。