「视觉基准测试」共找到 2538 篇相关文章
空间智能新作,影石开源户外全景重建算法
近日,Insta360 研究院联合高校提出 PanoLOG,首个面向全景输入的大规模户外三维重建工作。它解决全景分区难题,在多基准上取得领先渲染质量与小模型体积,还为户外具身智能等提供新思路。
10 人 1600 万美金 ARR,华人团队 OpenArt 用了这 11 个 AI 技术栈
华人团队 OpenArt 10 人团队做到 1600 万美金 ARR,CEO Coco Mao 分享经验。包括找准定位,聚焦三类核心用户;用程序化 SEO 实现增长;战略转型做视觉故事讲述;解决角色一致性问题,还介绍多方面技术栈。
搜攻略到凌晨3点?飞猪AI“问一问”用1张表谋杀废话
作者用旅游方案提示词测试各类Agent产品,多输出废话。飞猪“问一问”旅行Agent却很厉害,能生成实用旅行规划,还给出汇总表格、地图、行程卡片等,考虑全面且细节丰富,还能找特价机票。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。
狂揽33.8K星!这款Postman替代工具,绝了,离线+Git协作太香
Bruno是开源API探索测试IDE,有自研Bru语言、离线存储和Git协作能力,是Postman等强力竞争者。它功能丰富,有跨平台支持等,技术架构优势明显,还给出实战演示和同类工具对比。
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
让大模型异步地增强推理能力
在大模型推理时代,Test - Time Scaling成提升能力重要方向,但面临效率问题。ATTS提出异步框架,加入共形预测筛选候选路径,实验显示其加速显著,将测试时扩展推进到‘有原则加速’阶段。
一次缓存引发的文件系统数据不一致问题排查与深度解析
本文详述由自研分布式文件系统客户端 EFC 缓存架构更新引发的数据不一致问题排查过程。经多轮分析,发现是版本号回退致客户端读旧数据。修复后测试无异常,还揭秘部分 POSIX 接口底层情况。
AI编程里程碑!谷歌AI自己写代码惊呆工程师,GPU内核算法反超人类21%
谷歌AlphaEvolve的开源实现OpenEvolve自学写代码,在苹果芯片上进化出比人类快21%的GPU核函数。它自主发现多项优化策略,经多维度测试,性能显著提升,开启「AI为AI编程」新时代。
RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈
大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。