「独立测评」共找到 344 篇相关文章
BigQuery 新功能:SQL 直调 17 万 + AI 模型,3800 万行数据处理成本仅 2 美元
Google为BigQuery推出面向开源模型的第三方生成式AI推理功能,允许数据团队用SQL语句部署运行Hugging Face或Vertex AI Model Garden的模型,消除对独立ML基础设施的需求,解决数据团队痛点。
美团开源新模型,多项能力实测第一
美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制和高效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。
OpenAI编程新王GPT-5-Codex发布,7 小时搞定复杂代码,准确率飙升
OpenAI发布编程系统GPT - 5 - Codex,它是GPT - 5针对Codex产品的升级。能独立处理复杂编程任务,在性能、代码审查、前端开发等方面表现出色,还有严密安全体系,驱动Codex产品生态升级。
会“思考”的目标检测模型来了!IDEA提出Rex-Thinker:基于思维链的指代物体检测模型,准确率+可解释性双突破
现有目标检测方法有决策不透明和拒识能力不足问题。IDEA提出Rex - Thinker,引入“逻辑推理链”,构建可解释推理框架,经两阶段训练,在测评中准确率提升,可解释性强,有良好泛化能力。
刚刚,马斯克发布Grok-4,在各大基准测试上表现太猛了。
马斯克的 xAI 发布 Grok - 4,在各大基准测试表现出色,如 AIME25 拿满分、GPQA 领先等。第三方测评显示其登顶,编码和数学指数居首。价格与 Grok 3 相同,今日上线但价格高,甚至有已售罄情况。
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
这个免费的任务助手登顶 SuperCLUE-XClaw 榜单
近日,SuperCLUE - XClaw发布最新测评榜单,百度文心助手在十个参评的国产龙虾产品中夺冠,获97.62分。SuperCLUE是关注中文大模型评测的第三方体系,其榜单受业内关注。文心助手还是免费的。
全球首富红眼All in!马斯克600亿收购Cursor,挤上ASI末班车
SpaceX签署最终协议,600亿全股票收购Cursor母公司Anysphere。马斯克的xAI发展不顺,而Cursor被Anthropic打压。编程工具赛道已三分天下,Cursor是独立入口,马斯克此举是为搭上ASI末班车。
M2模型杀回Coding和Agent领域,MiniMax想要「普惠智能」
如今大模型竞争转向综合比拼,MiniMax 发布并开源 M2 模型,在权威测评跻身全球第一梯队。它定位轻量级,Coding 与 Agentic 能力强,性价比高,还升级 Agent 产品,以技术普惠策略让用户零成本体验。
Meta、OpenAI 争抢收购 OpenClaw!创始人艰难抉择:月入不到2万刀赔钱养项目,Offer拿到手软,对几十亿融资没兴趣
OpenClaw创始人Peter Steinberger分享成名经历,项目亏损但收到OpenAI、Meta收购意向,他要求开源。他还谈AI观点,如安全恐慌被放大、AI不会取代程序员核心能力,且AI Agent将取代80%独立App。