X - BENCH」共找到 466 篇相关文章

新闻资讯8

一场文心大模型的「AI马拉松」

2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。

机器之心
新闻资讯7

马斯克:Grok 5 将实现真正的 AGI

Vending Bench测试中,xAI的Grok 4以近两倍销售量和31%高收益击败GPT - 5,展现惊人稳定性。马斯克却称Grok 5有机会成真正AGI,引发网友各种反应,Grok 4虽领先但也有争议。

AGI Hunt
新闻资讯7

TypeScript“杀疯了”!60% 到 70%YC 创企用它构建 AI Agent,超越 Python 有戏了?

近日,Mastra AI 创始人称约 60 - 70% 的 YC X25 Agent 公司用 TypeScript 构建 AI Agent。该语言在 AI 应用开发优势明显,OpenAI 等也加大支持,但业内认为目前 Python 主导地位难被取代。

AI前线
新闻资讯7

连肝36小时不睡!00后天才工程师,瘫坐特斯拉靠FSD保命

xAI工程师Parsa Tajik连续工作36小时后瘫坐特斯拉发X平台,同事纷纷叫好,马斯克也回应。xAI秋天忙碌,此前有裁员等情况。Tajik回应网友担忧,称拼车靠FSD安全回家。

新智元
新闻资讯7

马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?

新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。

新智元
推荐文章7

一文读懂:数据中心“拥抱”ARM架构,为何如此艰难?

文章探讨企业数据中心采用ARM架构面临的难题。如现有x86架构主导,切换有兼容性问题;ARM硬件选择有限、性能不足;云服务功能难对等;软件支持和许可证问题也阻碍其应用。

芯师爷
算法论文7

AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?

研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。

新智元
产品应用7

首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例

OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。

AI进修生
产品应用8

刷榜风波惊动OpenAI后,这家中国团队拿回Agent硬核榜单第一

在OpenAI主导的MLE - Bench基准测试上,百度伐谋2.0击败对手登顶。此前有团队刷榜引发风波,官方新增清洁赛道。伐谋2.0在多方面优化,还在汽车、金融、科研等产业落地解决难题。

机器之心
新闻资讯7

锚定未来,安谋科技Arm China发布"AI Arm CHINA"战略

在ICCAD - Expo 2025上,安谋科技Arm China CEO陈锋发布“AI Arm CHINA”战略,表明全力投入AI决心。AI重塑产业逻辑,安谋科技发挥桥梁作用,推出“周易”X3等产品,构建AI计算生态。

芯师爷