算法论文8
RISEBench暴露模型编辑短板
量子位
AI 摘要
上海AI实验室等团队:推出RISEBench评测新基准,测试显示GPT - 4o - Image在复杂任务中准确率仅28.9%,当前视觉编辑模型理解能力不足,闭源与开源差距大。
阅读原文 · 量子位
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
智谱 GLM - 5.3 Flash 开源,低价高能来袭
Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。
歸藏的AI工具箱
开源动态8
港科大同腾讯开源3D构建框架超GPT - 5.5
香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。
机器之心
产品应用7
黄益贺:本地部署Qwen 3.8 27B方案揭秘
Qwen 3.8 27B是性能好、体积小的开源模型,个人也能本地部署。本地跑开源大模型,重点看容量和带宽两个指标,还介绍了Mac、RTX 5090、RTX PRO 6000三种部署方案及优缺点。
newtype AI
新闻资讯8
OpenAI亲儿子自研模型选中国K3
OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。
新智元