「推理能力评测」共找到 4914 篇相关文章
马斯克Grok 4.1双冠封王,爆冲第一!AI王座一夜易主
马斯克携xAI推出Grok 4.1并免费开放。它在LMArena和EQ - Bench登顶,写作Elo提升600分、幻觉率降3倍。后训练RL规模扩大,还经盲测评估,在多方面表现出色。
全球各地都让Claude做什么?
Anthropic第三期经济指数报告显示,Claude使用存在地域差异,与收入、经济结构有关,使用模式在变,自动化对话比例上升,企业更爱自动化且看重能力,人们对AI信任增加。
腾讯音乐如何基于 AutoMQ 降低 Kafka 50%+ 成本
腾讯音乐旗下产品产生海量数据,传统自建 Kafka 集群运维复杂、成本高。为此,运维团队选 AutoMQ,将成本降超 50%,提升扩缩容效率,降低运维负担,本文分享其经验。
TileLang深入详解-第一章-GPU 体系结构复习
作者借长假学习 TileLang 并撰写此文,先复习 GPU 体系结构,包括计算与线程组织、存储层次、专用指令单元,接着介绍核心性能模型与优化原理,最后给出基于 TileLang 的基准测试实践。
字节推出X-Streamer,实时口型同步与长程记忆数字人框架
字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。
突发!Claude 4.5 发布,这次更新不止是模型!
Anthropic发布Claude 4.5,在编程等任务中表现优于GPT - 5。Claude Code升级,API添新功能,模型能力提升,对齐性改善。还推出Claude Agent SDK及“Imagine with Claude”功能。
开源|Python 应用往微服务迈进的 1*3 种 Pythonic 步伐
在微服务架构主流的当下,Java凭成熟生态占主导,Python开发者面临尴尬。为此开源了`nacos-serving-python`项目,介绍全新Python微服务解决方案,涵盖服务发现策略、三种自动注册方式等内容。
把AI装进数据库:PostgresML和Korvus的新思路
当下机器学习应用开发流程复杂,开源数据库Postgres带来惊喜。PostgresML团队让AI模型跑在数据库中,介绍了PostgresML和Korvus两个关键项目,二者结合降低复杂度,让‘在SQL里跑AI’成工程现实。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
两份报告,两种 PMF:ChatGPT 跑通了 Copilot,Claude 验证了 Agent
OpenAI和Anthropic发布核心产品使用报告,展现ChatGPT和Claude用户心智差异。ChatGPT像Advisor,以询问、写作为主;Claude似Agent,随模型能力提升,用户倾向用其执行自动化任务。