视觉能力评估」共找到 4137 篇相关文章

算法论文8

斯坦福、英伟达和伯克利提出具身Test-Time Scaling Law

斯坦福、英伟达和伯克利团队提出具身Test - Time Scaling Law。研究发现推理时增加计算量可提升VLA模型性能,揭示动作误差与采样数量幂律关系,还探讨关键问题,给出方法,实验证明结合RoboMonkey能显著提升性能。

机器之心
算法论文8

Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明

Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。

Founder Park
新闻资讯8

为什么 OpenAI 们都要搞 AI 基建?Groq 创始人把背后的逻辑讲透了

文章通过对Groq创始人Jonathan Ross的访谈,探讨AI基建问题。指出AI应用增长受限算力,算力提升易见效,自研芯片可掌控命运。还分析芯片制造难点、市场供需、能源需求等,预测AI将带来用工短缺和新产业。

Founder Park
产品应用7

实测Kimi全新Agent模型「OK Computer」,很OK

Kimi发布全新Agent模型「OK Computer」,依托Kimi K2,能搭网站、做PPT、处理大量数据。实测显示它在设计、生成、分析类任务表现不错,设计无需找素材,分析无需想角度,生成还能推荐风格。

量子位
算法论文8

比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升

中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。

新智元
7

你可能没注意,腾讯已经把 AI 融进了这两个关键场景

作者参加腾讯全球数字生态大会AI协同办公与组织升级专场,关注腾讯乐享AI知识库和腾讯电子签合同智能引擎。乐享解决传统知识库痛点,让知识融入工作流;电子签实现合同管理全流程智能化,解放法务劳动力。

MacTalk
新闻资讯8

刚刚,OpenAI在ICPC 2025编程赛上满分登顶,Gemini也达到金牌水平

在ICPC 2025编程赛上,OpenAI 5小时内解决12个问题满分登顶,其由通用推理模型集成体构成,结合GPT - 5与实验性模型;Gemini解决10个问题达金牌水平,在部分难题表现出色。

机器之心
产品应用8

谷歌Nano Banana全网刷屏,起底背后团队

谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。

机器之心
开源动态8

蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录

蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。

量子位
算法论文8

We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系

北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。

机器之心