视觉评测」共找到 1224 篇相关文章

算法论文8

T2R-Bench发布:业内首个由表格生成报告工业基准

为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。

CourseAI
开源动态8

Hugging Face 推出九大 AI 课程,免费、全面【收藏】

Hugging Face悄悄上线一批免费AI课程,还带认证证书。课程从大语言模型到扩散模型,从计算机视觉到游戏AI,覆盖面广。完成课程可拿证书,还能在平台分享成果,是学习AI的好机会。

AGI Hunt
开源动态8

告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena

上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。

量子位
算法论文8

UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由

随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。

AINLPer
开源动态8

革命性突破!Windows-MCP 开源:AI 助手直接操控实体电脑,告别按键精灵!

在AI驱动的桌面自动化领域,传统工具部署复杂且性能受限。最近GitHub开源的Windows - MCP工具,能让AI助手与Windows UI原生交互,可进行点击、输入等操作,支持Windows 7 - 11,无需传统计算机视觉技术。

开源星探
产品应用8

4K-Agent:可将低分辨率图像提升至4K高清智能体

图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。

AIGC开放社区
开源动态8

看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源

上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。

量子位
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
新闻资讯7

12年首次大改!真有人喜欢苹果的“液态玻璃”吗?至少Flutter 开发者的噩梦开始了

在 WWDC 2025 上,苹果宣布在多操作系统引入‘液态玻璃’新视觉风格,是 12 年来最大 UI 革新。这或成苹果移动端外观重大转变,但也掩盖其 AI 落后现状,还让开发者面临功耗、适配等挑战。

InfoQ
开源动态8

红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用

红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。

Founder Park