空间能力评估」共找到 4081 篇相关文章

新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
推荐文章8

Agent开始“自我进化”:会出题、会反思,还会自己长出新技能

文章围绕自进化Agent展开,介绍其概念、受重视原因及三大技术路线,涵盖各路线代表工作的特点、评估及对比,指出研究空白如总结者训练等,最后还介绍了基于Agentic AI的全链路数据助手Dola。

腾讯技术工程
推荐文章7

为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。

宝玉AI
算法论文8

NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集

港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。

机器之心
产品应用8

人人可用、真能落地,阿里用Agent掀翻了数据分析的牌桌

文章介绍阿里全资子公司瓴羊升级“智能小 Q”,这是阿里在数据分析赛道的首份 Agent 答卷。分析了数据分析从可视化、可决策到可行动的三阶跃迁,阐述智能小 Q 在准确性、企业级能力、价值增量方面的表现及应用案例。

InfoQ
产品应用8

突发!Claude Opus 5深夜震撼发布,多项跑分锤爆Fable 5,价格腰斩

Claude Opus 5正式发布,总体智能逼近Claude Fable 5,价格仅为一半,多项跑分超Fable 5。它专为高频使用设计,各领域进步显著,有强自我验证和迭代能力,还发布API更新与提示词编写指南。

AI寒武纪
新闻资讯7

翁荔创业大模型首秀!告别“120亿美元估值0模型”

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
产品应用8

GPT-5.2技术炸场!6大核心突破,办公效率拉满

OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6大核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。

CourseAI
产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化
新闻资讯7

Vercel CEO爆Kimi K2智能体准确率超GPT-5 50%?国产的风还是吹到了硅谷

Vercel CEO称内部测试中,国产Kimi K2模型运行速度和准确率均优于GPT - 5和Claude Sonnet 4.5。硅谷多家公司已接入或转用K2,K2 Agent能力也经受住检验,还给出使用和价格相关信息。

AI寒武纪