AGI测试」共找到 2158 篇相关文章

新闻资讯7

小扎开9位数薪酬新建AI团队!砸千亿收购华人初创公司,Llama 4太拉胯急坏了

Meta CEO扎克伯格对Llama 4表现失望,一边开7 - 9位数薪酬从谷歌、OpenAI等公司挖人组建新AI实验室,另一边豪掷148亿美元收购初创公司Scale AI 49%股份并挖来CEO,Llama 4在第三方测试中表现不佳。

量子位
算法论文8

只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%

南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。

新智元
产品应用8

Claude Opus 5 发布,比 Fable 5 强,仅一半价格

Claude Opus 5发布,官方称其以一半价格提供接近Fable 5的智能。跑分显示它多数项目超Fable 5,ARC - AGI - 3成绩突出,还更省token,是Anthropic迄今对齐度最高的模型。

AGI Hunt
开源动态7

The Batch: 907 | 小而高效模型的“制作”方法

Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。

DeeplearningAI
新闻资讯7

哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈

哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。

量子位
开源动态8

开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具

Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。

量子位
产品应用7

Excel上微软式创新!=COPILOT()函数发布

微软CEO宣布Excel新功能`=COPILOT()`函数,可在单元格直接调用AI。它能进行文本分析、生成内容、整理数据,与计算引擎集成,结果随数据自动更新。现处测试阶段,有调用限制和版本要求。

AI工程化
新闻资讯7

GPT-5:我更强了,就这?“看不见”的升级

OpenAI 发布 GPT - 5,它未带来 AGI 相关的震撼升级,而是更注重实用。其训练有新特点,具备推理强、编程能力提升等特性,是 AI 从‘模型炫技’到‘产品体验打磨’转变的标志。

MacTalk
新闻资讯7

先别急着给OpenAI加冕!陶哲轩:这种「金牌」,含金量取决于「赛制」

OpenAI 官宣推理模型在 IMO 获金牌水平成绩,此前各模型表现不佳。数学家陶哲轩劝谨慎看待,认为无严格测试条件难比较 AI 与人类。网友看法不一,模型训练方法及 Alexander Wei 受关注。

机器之心
算法论文7

只因一个“:”,大模型全军覆没

一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。

量子位