大模型测试」共找到 9662 篇相关文章

8

模型与「壳」的价值同时被低估?真格基金戴雨森 2025 AI 中场万字复盘

这是真格基金管理合伙人戴雨森2025年中对AI行业的半年度复盘。他从投资人视角,围绕OpenAI通用模型达IMO金牌水准、ChatGPT Agent发布等热点,分享AI应用、模型、产品“壳”价值等看法,认为模型和应用价值被低估。

Founder Park
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
产品应用7

Thinking Machines 发布 Tinker API,实现灵活的模型微调

Thinking Machines公司发布Tinker API用于开放权重语言模型微调,可减少开发者基础设施开销。支持多种模型架构,集成LoRA,还发布开源存储库。虽有竞品,但Tinker侧重暴露低级原语,尚处封闭测试

AI前线
推荐文章7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对模型发展的影响及Claude模型意义。他指出Scaling Law源于问“蠢问题”,是推动AI进步核心动力,还给出产品构建建议,介绍Claude 4优化。

AI前线
新闻资讯7

DeepSeek流量暴跌?AI模型全球霸主离奇遇冷,外媒曝出真相

曾以低价高性能出圈的DeepSeek,在自家平台遇冷、市场份额下滑,但其R1和V3模型在第三方平台使用量增长近20倍。背后是‘Token经济学’及战略转移,它开源模型,将算力留作研发。Anthropic也因算力受限有类似问题。

新智元
算法论文8

ICML 2025 | 注意力机制中的极值:破解语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
新闻资讯7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对模型发展的影响及对Claude等模型的意义。他认为AI发展不平衡,建议构建未完全跑通的产品,还介绍了Claude 4优化,探讨人机协作等内容。

InfoQ
产品应用7

调高一档推理强度,成本可能翻几倍:模型思考原理讲清楚

文章详细讲解推理强度原理,指出其不改模型,只改草稿长度。还说明模型多思考能提高答题准确率的原因,剖析贵和慢的原因,介绍三种控制形态,并给出判断推理强度档位的框架。

AI Reading Hub
开源动态8

谷歌版小钢炮开源!0.27B模型,4个注意力头,专为终端而生

谷歌开源Gemma 3 270M,几分钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。

量子位
新闻资讯8

Open AI 新模型在 IMO 2025 上获得金牌!

OpenAI新模型在2025年国际数学奥林匹克(IMO)中达金牌水平,测试时不借助工具、不连互联网,且不太可能存在数据污染。该模型解决6题中的5题,非GPT - 5,近期也不发布。

歸藏的AI工具箱