「智能体基准」共找到 4096 篇相关文章
国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能
国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。
DeepMind大佬最新暴论:单体大模型穷途末路,未来买的不是模型,是"智能路由"
DeepMind研究员Andrew Trask认为,因Scaling Law对资源需求攀升,AI将成协议而非程序。组合不同厂商模型有优势,当主流榜单同等评分时变革加速,之后人们将买“智能本身”。
前百川智能联创焦可新创业公司曝光,新项目已上线 App Store
前百川智能联创焦可新创业公司曝光,其推出的AI语音产品“来福”已上线App Store。该产品定位AI语音电台应用,探索声音交互场景,目前仅邀测。国内大厂未推专注AI播客独立产品。
真实评估!北理发布全球首个「全场景教育」基准,支持4000+情境
北京理工大学高扬老师团队推出EduBench,是全球首个「全场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等全面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。
Demo的高估值时代结束了,具身智能开始按生产力重新算账
WAIC后具身智能进入冷静期,融资热但投资人关注点转变。过去‘PPT估值、Demo定价’,如今按生产力算账。分析了高估值由来、发展路径类似大模型,还给出衡量企业的四把尺子,并以酷哇科技为例说明。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。
Karpathy提的“软件3.0”已过时,交互即智能才是未来 | 上交大&创智刘鹏飞
上海交通大学刘鹏飞团队认为,2024年9月后,大神Karpathy提出的“软件3.0”已过时,“软件3.5”应运而生。其核心是“交互即智能”,在自然语言易用性基础上实现人机交互认知层面突破。
OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。
Agent 元年已至,我们会拥有自己的智能助理吗?|GAIR Live 预告
2024年被认为是「Agent元年」,智能体浪潮正改写工作与生活。6月14日上午10点,GAIR Live线上圆桌论坛将围绕「Agent」话题展开,5位一线嘉宾探讨其发展阶段、应用方向等关键议题。
阿里亲身入局具身智能!Qwen内部组团,通义千问技术负责人带队
阿里Qwen团队组建具身智能小分队,由通义千问技术负责人林俊旸带队。外媒称这是阿里最明确的物理AI系统探索,此前阿里已有投资布局,此次是其AI战略关键落点。