人工智能评估」共找到 1182 篇相关文章

算法论文8

GUI定位还在玩「非黑即白」?浙大团队提出GUI-G²,显著提升GUI智能体定位性能

人工智能领域,GUI 智能体成技术风口,但现有 GUI Grounding 方法有缺陷。浙大团队提出 GUI - G²,将 GUI 交互转变为连续空间建模,在三个主流 GUI 定位基准测试中表现亮眼,重新定义了 GUI 交互本质。

机器之心
新闻资讯8

尖峰对话17分钟全记录:Hinton与周伯文的思想碰撞

7月26日,人工智能教父Geoffrey Hinton与周伯文教授进行17分钟对话,谈及AI多模态大模型前沿、“主观体验”和“意识”等话题。Hinton认为当今多模态聊天机器人已有意识,还探讨了训练善良AI及AI推动科学进步等问题。

机器之心
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
开源动态8

看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源

上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。

量子位
新闻资讯8

全国首部!AI 大模型私有化部署标准起草单位 / 个人征集启动!

国内首部AI大模型私有化部署标准《人工智能大模型私有化部署技术实施与评价指南》立项,正征集起草单位和起草人。该标准全流程覆盖、多方面融合、三方协作,能解决企业部署痛点,构建安全可信生态。

AI大模型应用实践
开源动态8

生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架

港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。

量子位
开源动态8

全球首个AI智能体「自进化」开源框架来了!一次部署,终生可用

英国格拉斯哥大学团队发布全球首个AI智能体自进化开源框架EvoAgentX,打破传统多智能体系统构建与优化限制。它有自动化构建、自进化机制和系统性评估亮点,实验验证其性能提升显著。

新智元
新闻资讯7

他想让TPU成为AI界的X86!

2026世界人工智能大会期间,中昊芯英主办分论坛,新一代全自研TPU架构AI芯片“须臾®”亮相,华东地区首个国产TPU智算千卡集群落成。“须臾®”算力强、成本低,集群全链路国产化,中昊芯英探索TPU突围路径。

芯师爷
算法论文7

AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight

UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证。

机器之心
新闻资讯7

你要做旁观者,还是定义者?中关村两院全球寻找「AI时代架构师」

中关村两院(北京中关村学院与中关村人工智能研究院)一体两院、融合发展,现全球招募AI时代架构师,包括领军人才、青年科学家、应届博士/博后等,介绍了招聘方向及优厚待遇,还将召开人才闭门交流会。

机器之心