「基准榜单」共找到 1481 篇相关文章
AI 真的能帮你微信下单了!
微信支付发布「AI 专属卡」,WorkBuddy 率先接入。用户在 WorkBuddy 能让 AI 找外卖、选套餐、领券、下单及支付。介绍了使用步骤,还说明 AI 专属卡支付安全,绑定还有彩蛋。
抢疯了!AI宠物翻译器:800多块,预售2万单
PettiChat宠物翻译器售价800多,预售2万单。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。
DeepSeek版Claude Code登顶热榜:8700星,鲸鱼哥火了
DeepSeek版Claude Code登顶GitHub热榜,Star量超8700且还在增长。DeepSeek TUI由Hunter Bown用Rust开发,能与DeepSeek深度集成,有多种模式,打破高价API限制,开发者是半路出家的程序员。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
世界模型评测的最大盲区,被这个新基准捅破了
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
独家丨国内人形机器人首笔千台级商单出现
AI科技评论独家获悉,星尘智能与仙工智能达成人形机器人千台级订单战略合作,今年4季度起部分交付。这是国内人形机器人在工业领域最早一批千台级商单,双方采取‘供应链+产品+渠道’合作。
3000亿美元OpenAI大单,让世界首富位置换人了
甲骨文发布2026财年第一财季业绩,未交付合同总值暴增,云业务收入预计大幅增长。受此影响,股票涨超35%,创始人埃里森身家一度超马斯克成首富。其未交付大单或来自OpenAI 3000亿美元算力合同。
字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军
字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。
刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+
北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。