「Agent评测」共找到 3194 篇相关文章
Notion CEO Ivan Zhao:好的 AI 产品,做到 7.5 分就够了
Notion CEO Ivan Zhao 在播客采访中分享打造 AI 产品的观点。他认为 Notion 整合 SaaS 成生产力工具,数据库是核心。好产品做到 7.5 分即可,构建 AI 产品像“酿啤酒”,知识工作领域 Agent 未真正出现。
刚刚,百度最新开源神作:PaddleOCR-VL-1.5上线了
1月29日百度开源新一代文档解析模型PaddleOCR-VL-1.5,参数仅0.9B,在OmniDocBench V1.5评测中综合性能全球第一,精度达94.5%。它支持异形框定位,解决真实文档解析难题,在多场景表现出色。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
阿里云 CIO 蒋林泉:AI 大模型时代,我们如何用 RIDE 实现 RaaS 的首次落地?
阿里云 CIO 蒋林泉分享大模型落地实践,指出 AI 是时代“大电梯”,企业需迅速搭乘。介绍阿里云数字人多场景应用成果,提出 RIDE 方法论助企业落地,还剖析翻译与 Agent 模式要点及 E2E 落地关键。
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。
1.93bit版DeepSeek-R1编程超过Claude 4 Sonnet,不用GPU也能运行
1.93bit量化后的DeepSeek - R1(0528)编程能力超Claude 4 Sonnet,在aider榜单获60分。Unsloth工作室制作9个量化版本,小版本不用GPU也能跑。R1 - 0528在游戏评测中表现也佳。
Karpathy的编程经验Skills,开源了,Star涨疯了。
周末,Karpathy大佬的编程经验开源skills项目火了,它把其吐槽大模型写代码的问题编译成大模型可理解的约束。安装简单,还列举了一些规则示例。如今行业把人的经验编译成Agent可执行格式,开源范式改变。
微信AI绝密计划曝光!但一个前腾讯员工,已经在硅谷做出来了
腾讯正为微信秘密开发AI智能体项目,计划2026年年中灰度测试,三季度全量上线。而前腾讯工程师已在硅谷做出全球首个人类与AI共生社交网络Teamily AI,能让Agent进群协作,有三层架构支撑。
一夜暴涨至2100亿!开源新王MiniMax M2.5,革了Opus 4.6的命
新智元报道,国产AI春节档,MiniMax M2.5昨夜登场,今日市值涨至2108亿港元。其编码性能逼平Claude Opus 4.6,价格仅为1/20,适配开发者工具,在办公、深度研究等场景表现出色,基于Agent RL技术体系。
实测 Seed 2.1 Pro:从零到一,开源一个大学生就业补贴的公益网站
火山引擎在 Force 大会发布豆包大模型 Seed 2.1 Pro 系列,API 上线火山方舟。作者实测用其完成大学生就业补贴政策网站开源项目,展示模型 Coding 和 Agent 能力,还提及性能、成本等优势及后续计划。