视觉基准测试」共找到 2535 篇相关文章

开源动态8

性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE

近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。

PaperAgent
算法论文8

让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」

在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。

量子位
开源动态8

Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!

Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。

小华同学ai
产品应用7

自动化浏览器

Skyvern是能自动化浏览器操作的工具,底层靠大语言模型和计算机视觉。它提供简单API接口,可在大量网站自动化手动操作,替代易出错的自动化方案。介绍了其原理、使用方法、功能等。

GitHubStore
新闻资讯8

别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师

斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。

量子位
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
算法论文7

AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!

现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。

深度学习自然语言处理
产品应用8

阿里「快乐小马」来了,首批网友已玩疯!720P低至0.44元/秒

今天,阿里HappyHorse - 1.0开启灰度测试。它有电影级叙事质感,指令遵循能力强,能驾驭多种风格,还可一句话改视频。性价比高,720P低至0.44元/秒,让AI视频从‘玩具’变‘工具’。

新智元
新闻资讯7

今天,Anthropic偷偷移除了Pro用户的Claude Code访问权

Anthropic一度将Claude Code从Pro套餐移除,引发开发者不满,数小时后官网回滚,负责人称是小范围测试。Claude Code因高消耗或调整收费,Anthropic正修正订阅模型,这或改变开发者工具格局。

新智元