空间能力测评」共找到 3630 篇相关文章

新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
算法论文8

NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集

港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。

机器之心
产品应用8

人人可用、真能落地,阿里用Agent掀翻了数据分析的牌桌

文章介绍阿里全资子公司瓴羊升级“智能小 Q”,这是阿里在数据分析赛道的首份 Agent 答卷。分析了数据分析从可视化、可决策到可行动的三阶跃迁,阐述智能小 Q 在准确性、企业级能力、价值增量方面的表现及应用案例。

InfoQ
产品应用8

突发!Claude Opus 5深夜震撼发布,多项跑分锤爆Fable 5,价格腰斩

Claude Opus 5正式发布,总体智能逼近Claude Fable 5,价格仅为一半,多项跑分超Fable 5。它专为高频使用设计,各领域进步显著,有强自我验证和迭代能力,还发布API更新与提示词编写指南。

AI寒武纪
新闻资讯7

Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车

Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。

AI科技评论
新闻资讯7

翁荔创业大模型首秀!告别“120亿美元估值0模型”

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
产品应用8

GPT-5.2技术炸场!6大核心突破,办公效率拉满

OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6大核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。

CourseAI
产品应用8

聚焦手机AI“超级入口”,中兴Nebula小模型让手机秒变“小秘”?

移动智能时代,手机AI“超级入口”成竞争焦点。美团率先推出AI Agent,中兴通讯自研Nebula-GUI模型表现亮眼,在测评中获佳绩,已在多款手机商用,还开发数据制备系统,经监督微调、双层强化学习提升性能。

量子位
产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化
新闻资讯7

Vercel CEO爆Kimi K2智能体准确率超GPT-5 50%?国产的风还是吹到了硅谷

Vercel CEO称内部测试中,国产Kimi K2模型运行速度和准确率均优于GPT - 5和Claude Sonnet 4.5。硅谷多家公司已接入或转用K2,K2 Agent能力也经受住检验,还给出使用和价格相关信息。

AI寒武纪