「视觉基准测试」共找到 2538 篇相关文章
让图像生成告别 AI 味!清华 + 港中大 + 腾讯混元联手推出SRPO
腾讯混元联合港中大、清华推出SRPO,解决文生图技术痛点。它结合Direct - Align和SRPO,提升图像审美等,训练时间缩至十分钟,在测试中碾压主流方法,不过对冷门风格控制和机制可解释性待提升。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频
智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。
智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象
上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
Hexstrike AI的安装及交互跟踪环境
Hexstrike AI是基于专业化Agent协同的智能渗透测试系统,有强大自动化攻击能力。文章介绍其安装方法,包括服务端和客户端配置,还提及搭建跟踪系统及后续计划,将深入分析专业AI代理原理及关注v7.0新功能。
GPT-5 在 Lovable/Vibecode 中氛围编码,附 GLM-4.5 对比 (反向搜索引擎、吵架的俄罗斯方块)
文章展示GPT - 5在网页端、Lovable、Vibecode的测试案例,与GLM - 4.5对比。如GPT - 5在WebDev Arena创纪录,不同版本使用限制不同。还列举多个应用案例,指出GPT - 5有不足,GLM4.5全栈开发表现不错。