「具身操作评测」共找到 2042 篇相关文章
小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?
小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。
比 Playwright 更给力,这个新开源的项目6啊~
GitHub上的BrowserAct项目是面向AI Agent的浏览器自动化CLI,是为AI Agent设计的真实浏览器执行层。它有三层反检测突破体系、三种浏览器模式等功能,能解决Agent操作浏览器的诸多问题,适合多场景。
刚刚,百度最新开源神作:PaddleOCR-VL-1.5上线了
1月29日百度开源新一代文档解析模型PaddleOCR-VL-1.5,参数仅0.9B,在OmniDocBench V1.5评测中综合性能全球第一,精度达94.5%。它支持异形框定位,解决真实文档解析难题,在多场景表现出色。
英伟达2026奖学金,8位华人博士统治榜单!人均6万美金
2026 - 2027年度英伟达研究生奖学金名单揭晓,10位获奖者中华人学者占8席。该奖学金提供最高6万美金科研经费与暑期实习机会。研究方向涵盖神经渲染、AI安全等,体现英伟达关注具身智能和AI安全。
从Demo到行业落地的Agents:技术、应用与评估
通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。
英伟达的局:狂撒15亿美元,从Lambda那租到了搭载自家AI芯片的GPU服务器
据The Information消息,英伟达与小型云服务提供商Lambda达成15亿美元合作,租赁其搭载自研AI芯片的GPU服务器。这并非首次,此前已对CoreWeave如此操作。目的是维护其在云计算市场的主导地位。
从刮胡子机器人到双臂神技!这家具身独角兽引爆亿级美元融资热潮
具身智能大热,Generalist AI展示「拂晓」仿人自适应机器人完成高难度任务。日前,非夕科技宣布完成C轮亿级美元融资。该公司由前DeepMind科学家创立,获英伟达投资,其机器人在多领域有应用。
1.93bit版DeepSeek-R1编程超过Claude 4 Sonnet,不用GPU也能运行
1.93bit量化后的DeepSeek - R1(0528)编程能力超Claude 4 Sonnet,在aider榜单获60分。Unsloth工作室制作9个量化版本,小版本不用GPU也能跑。R1 - 0528在游戏评测中表现也佳。
WorkBuddy杀疯了?一群AI专家帮我打工,我在微信里当赛博虾工头!
本文介绍腾讯推出的全场景职场AI智能体桌面工作台WorkBuddy。它内置多领域垂类专家,能接管自媒体内容创作流水线,还接入微信ClawBot插件方便操作。部署和技能配置门槛低,内置主流模型,还有免费Credits福利。
童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了
Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。