测试套件规模」共找到 2140 篇相关文章

产品应用7

R2没来,却等来综合性能更优的DeepSeek R1T2

抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。

PaperAgent
新闻资讯7

OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密

SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。

新智元
新闻资讯7

一夜裁员4000人!前推特CEO挥刀,硅谷白领的安全感崩了

金融科技巨头Block毫无征兆裁掉4000人,CEO称是智能工具催生新工作方式。但专家指出AI未大规模提高生产效率,裁员或因人员臃肿和财务问题,如今白领工作受AI冲击大。

新智元
新闻资讯8

Chiplet(芯粒) —— 后摩尔时代的芯片“乐高”玩法

当单芯片逼近物理极限,Chiplet技术应运而生,它将大芯片拆分成小芯片,通过先进封装技术整合。该技术成本低、良率高,应用场景多元,但面临热管理、测试和标准统一等挑战,未来发展前景广阔。

芯师爷
推荐文章7

反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?

作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。

探索AGI
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
开源动态7

DeepSeek-R1今天一次「小更新」,颠覆了大模型格局,网友:尽快放R2

昨晚,DeepSeek官方宣布其R1推理模型升级到最新版本(0528),并公开模型及权重。该版本参数量高达6850亿,采用MIT许可证,性能提升明显,在多个基准测试中成绩优异,网友实测代码能力也大幅提升,但仍存在过度思考问题。

机器之心
产品应用8

别只做skill了,都去做插件吧

Claude Code的插件系统上线,解决了配置难分享、版本化和审核的问题。它将已有能力标准化,介绍了插件与独立配置选择、上手步骤、可装内容、测试方法、提交市场及从独立配置迁移等内容,还提及其他软件推插件市场。

AI工程化
产品应用8

刚刚,Claude 5.1 发布!全球最强模型来了

Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1面向普通用户等,Mythos 5.1面向高风险领域伙伴。Fable 5.1性能优、价格低,在多测试中表现提升,还能用于科研,且安全防护机制升级。

机器之心
新闻资讯7

Claude还是最强,但Anthropic这周好像疯了

Anthropic状告阿里蒸馏模型致其股价创新低。一位87年创业者用AI搭工作流,起初用DeepSeek和Qwen问题多,换Claude后流程顺畅。MRCR v2测试显示国产模型与Claude有差距,便宜与省心模型该怎么选成问题。

探索AGI