「GPT4」共找到 2125 篇相关文章
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
WAIC 2025大黑马,一个「谢耳朵AI」如何用分子式超越Grok-4
当Grok - 4讲冷笑话时,中国科学家用书生Intern - S1破解癌症药物靶点密码。7月26日上海AI实验室发布并开源Intern - S1,多模态能力全球开源第一,相关平台也上线,有望重构科研生产力。
GPT-5几个预测:用户翻倍,编程登顶,屠杀一众模型
OpenAI发布GPT-5,登顶大模型测评榜单。它有统一智能架构,在多测试取得突破,编程能力强击败对手。还改进意图,减少幻觉、增加情感、在健康领域更实用,价格便宜。作者预测其将带来用户翻倍等影响。
GPT-5.2发布,真正的牛马打工人专属AI来了。
OpenAI十周年凌晨2点发布GPT - 5.2。它在部分跑分上提升不大,但在ARC - AGI - 2和GDPval评测集表现亮眼,上下文处理能力也大幅加强。将开放给会员使用,价格比5.1贵。
马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜
马斯克发布Grok 4.1,同时霸榜大模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。
17000 tokens的GPT-5系统提示词被意外泄露,以及八点总结~
OpenAI GPT - 5的system prompt被曝光在github,约17803 Tokens、78960 Characters。文章对提示词做八点分析总结,如互动风格、写作要求、工具使用等,还给出工具部分重点。
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作
Meta超级智能实验室首个作品Muse Spark上线,跑分从18飙到52,盘中暴涨10%。它是「全能六边形战士」,有原生多模态感知等能力,上线「沉思模式」,功能先在美国铺开,未来接入社交平台,免费用但闭源。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem
北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。