多模态处理能力」共找到 4420 篇相关文章

开源动态8

50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。

Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。

探索AGI
新闻资讯8

前端危!Gemini 3内测结果获网友一致好评,“有史以来最强前端开发模型”

谷歌下一代旗舰模型Gemini 3未发布便走红,内测结果显示它擅长前端、SVG矢量图生成,多模态能力更强。网友实测其在编程、绘图等方面表现出色,疑似谷歌内部文件显示发布时间为10月22日。

量子位
算法论文8

BookRAG:专治各种「层次化复杂」文档

BookRAG专为处理层次化复杂文档而生。传统RAG有两大盲区,而BookRAG在多模态长文档基准上刷新SOTA。它采用BookIndex×Agent - based Retrieval技术方案,效率高、可扩展性强,兼顾高精度、高召回、低成本。

PaperAgent
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
新闻资讯7

马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题

马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。

新智元
产品应用7

实测可灵O1,AI视频界的Banana也来了。

可灵推出全新多模态视频大模型可灵O1,融合多种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。

数字生命卡兹克
新闻资讯7

Claude降智实锤了!还变相涨价,Opus跌下神坛

AMD高级总监审计发现Claude处理复杂任务能力变差,第三方跑分排名下降。官方称调整是为平衡速度与成本,但用户认为是变相降智。此外,企业包月套餐涨价,而Anthropic将推Opus 4.7和新设计工具。

量子位
开源动态8

诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计

过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。

机器之心
产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化