多模态理解与生成」共找到 3423 篇相关文章

算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
开源动态8

字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理

字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。

机器之心
开源动态8

微软发布多智能体 Web 操作系统!让 AI 成为真正“可控、协同、透明”的网页执行助手!

微软推出新一代多智能体 Web 操作系统 Magentic - UI,它能自动浏览网页、处理数据等,具备多智能体协同能力。其界面透明可控,功能丰富,安装使用友好,适用于多种复杂场景。

开源星探
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
新闻资讯7

AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退

Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。

新智元
新闻资讯7

ChatGPT的记忆机制被公开了

OpenAI推出ChatGPT聊天历史记录记忆功能,默认关闭需手动开启,因未全面开放,技术大佬逆向工程破解机制。记忆系统分保存记忆、聊天记录等,体验反馈两极分化,有优势也有诸多bug。

量子位
推荐文章7

windsurf分享了他们对构建Agent应用的认知。

windsurf发表博客讨论Agent,指出构建Agent应用存在认知误区,分享灵魂四问分析框架评估其‘含金量’,还提到苦涩教训,提醒警惕过度设计,拥抱规模化、通用化方法。

探索AGI
推荐文章7

AI正在重塑商业,信任决定未来商业能走多远丨Visa大中华区总裁张文翊

Visa大中华区总裁张文翊认为,AI正重塑商业,智能体改变商业决策,信任决定其规模化。文章阐述AI重塑商业的三个转变、需关注的三个关键词,点明中国市场重要性及Visa探索方向。

量子位
开源动态7

爆火开源AI画布,真正可落地的手写AI黑板

文章推荐开源AI画布PenEcho,它是个超智能黑板,适合学习场景,让手写与AI共生。能理解内容及空间关系,把回答放回画布,支持多模型,还具备多种功能。

开源AI项目落地
新闻资讯8

Linus一句话说透Al局限:代码不能直接用,bug只能创可贴式地修

本文是 Linus Torvalds 在开源技术会议上与 Dirk Hohndel 的对话。Linus 从工程实践出发,谈到 Linux 内核开发节奏、硬件支持取舍、语言之争及 AI 应用。他认为 LLM 是工具,有价值但无法替代长期维护者经验。

InfoQ