「多模态处理能力」共找到 4444 篇相关文章
Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓
Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。
那个用半成品刷爆SOTA的Qwen3超大杯推理版,现在正式上线
阿里千问率先发布Qwen3-Max-Thinking正式版,刷新全球SOTA。该模型总参数超万亿,有技术创新,提升了推理性能和原生Agent能力。实测代码和工具调用能力强,还透露技术细节,中国开源模型影响力不断提升。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
低调霸榜全球最难SQL榜单超两月,国产AI这次选择高调开源!
蚂蚁数科低调霸榜全球最权威SQL榜单超两月后高调开源Agentar - SQL系列。其核心思想是让AI赋能生产,在金融场景验证后能力外溢到多领域,还采用按效果付费模式,展现强大竞争力。
刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking
美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
腾讯出手了!彻底入局Agent
腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点多,如可一键发布到企业微信,具备多工具调用、多Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。