「AGI基准测试」共找到 2500 篇相关文章
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。
CSDN智研社欧洲首聚,共话技术范式转换下的创新与合作
随着大模型代表的第四次技术革命进入关键期,科技范式转换。5月7日,CSDN智研社2025欧洲站首场线下活动在巴黎举办,众多人士交流分享,未来CSDN还将在更多国际城市办活动。
Claude 4 要来了!
AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
刚刚,OpenAI公司结构重大调整:继续由非营利实体控制,营利性部门要变公益公司
OpenAI官方宣布公司结构重大调整,将继续由非营利组织控制,现有营利部门成公益公司(PBC),非营利组织控制PBC并成大股东,二者使命相同。这是与相关部门对话后决定。
实测吓一跳,gpt-5.6居然比deepseek flash还便宜
上周GPT-5.6 luna打2折,次日梁圣的v4flash正式版发布。经实测,把GPT薅到极致比DeepSeek便宜,还整出无限活力流玩法。Luna max智力分值超Sol high,虽耗时久但成本低。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
突发,OpenAI总裁当庭「认罪」!自曝零元购300亿,马斯克这回真要赢了?
2026年5月奥克兰联邦法院,马斯克与OpenAI对簿公堂。OpenAI总裁Brockman当庭承认零投入获300亿美元股权,还涉及Cerebras自我交易。专家担忧AGI竞赛风险,双方各执一词,审判反映硅谷价值观冲突。
GPT-5.6现身后,下一个Claude Sonnet 4.8又曝光了!
GPT-5.5发布不久,开发者在Codex内部日志发现GPT-5.6,几乎同时,Anthropic的Claude Code源码泄露,炸出Sonnet 4.8、Jupiter等型号。两家公司下一代模型几乎同时曝光,模型迭代节奏在加速。
编程智能体的隐藏bug,被上交IPADS团队用数学逻辑给揪出来了
上海交通大学 IPADS 研究团队打造 FM - Agent,实现大规模系统全自动正确性推理。它能从顶尖编程智能体生成的大规模系统中找出隐藏 bug,还提出新规约生成方法,在绝对严谨与工程可用间找到平衡。