算法论文8
EdiVal - Agent终结图像编辑评测,Seedream 4.0夺冠
机器之心
AI 摘要
得克萨斯大学奥斯汀分校、UCLA、微软等机构研究者提出EdiVal - Agent评估框架。它能自动评测图像编辑模型,通过三步工作流实现。实验显示其与人类判断一致性高,对比13模型,Seedream 4.0排名第一。
阅读原文 · 机器之心
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
紫东太初GMC:少80%Token保多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
量子位
产品应用8
阿里「千问办公」公测,Qwen3.8 - Max上岗
8月,阿里「千问办公」开启公测,它整合三款产品,还接入最新旗舰Qwen3.8 - Max。该产品交付成果可用,可一站生成多模态内容和Office产物,与钉钉打通且有组织级Skill,优势明显。
新智元
产品应用8
Agnes AI实测:编程瓶颈在缓存命中率
本文实测Agnes AI,指出AI编程瓶颈在于缓存命中率,而非模型智商。介绍其产品线、评测成绩与价格优势,还分享客户端体验,包括亮点、回滚事故及日志结论,最后点明智能免费后验证更稀缺。
AI科技评论
开源动态7
pxpipe:压缩Fable 5上下文,大幅降成本
Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。
开源AI项目落地