GPT - 2 Small」共找到 2700 篇相关文章

新闻资讯8

全球顶尖大模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分

全球最难AGI测试ARC - AGI - 3上线,人类满分通关,最强模型Opus 4.6仅得0.2%。测试从静态题变为互动游戏,评分看效率。前沿大模型得分低,非LLM方案表现更好,AI缺乏元认知能力。

新智元
产品应用8

连肝12小时!一轮狂刷1500篇论文,写4.2万行代码,AI科学家卷疯科研圈

Kosmos是一款全程无需人类插手的AI科学家,最长能连续工作12小时,平均一次研究读1500篇论文、写4.2万行分析代码,79%研究结果可被人类复现,已在多领域有7个真发现。

量子位
新闻资讯8

AI也能当情感大师?腾讯发布最新AI社交智能榜单,最新版GPT-4o拿下第一

腾讯混元AI数字人团队打造SAGE自动化评估框架,可评价AI“共情力”与能否成“知心伴侣”。研究团队用其对18个主流模型测评,GPT - 4o表现最佳,还通过多实验分析模型特性。

量子位
开源动态8

7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了

研究团队发布全球首个医疗代码生成大模型训练平台MedAgentGym,提供评估基准和训练生态,提升大模型医疗代码生成与推理能力。经其训练的Med - Copilot - 7B达GPT - 4o相当水平,解决医疗AI编程瓶颈。

量子位
新闻资讯7

OpenAI深夜甩出GPT-5.1,称更热情,更智能!网友狂吐槽:我不想和它聊天,只想用它工作

OpenAI发布GPT-5.1,包括Instant和Thinking两个版本,称更智能、对话更愉快,还增加“个性/语气”选项。但网友质疑“强化个性”方向,想要高效工具而非“虚拟朋友”。

InfoQ
产品应用8

1美金时薪雇个全栈替身,MiniMax M2.5让打工人也能体验当老板的感觉

春节档模型大战,MiniMax官宣新模型M2.5,主打智能体和Vibe Coding,性能比肩Claude Opus 4.6。它全栈能力强,能处理长链路任务,推理吞吐量高、成本低,已接管MiniMax 30%真实业务。

量子位
算法论文8

手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里

中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。

量子位
新闻资讯8

GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷

Epoch AI和曼彻斯特大学发布FME基准测试论文,让68道未解数学难题成5个顶级AI的考场。GPT - 6 Astra成唯一得分非0分模型,放宽预算共解开5道,其余4个AI全交白卷。该测试是对陶哲轩批评的回应。

量子位
开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位
开源动态8

国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型

中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。

量子位