「AGI基准测试」共找到 2490 篇相关文章
回村拜年、赶集舞狮:一台小机器人的县城奇幻漂流|甲子光年
2026马年春节,人形机器人迎来高光。‘清华系’加速进化公司将小型人形机器人Booster K1带回乡村,在多样场景测试。该公司走小而美路径,产品性能优、销量好,通过B端、C端策略打开市场。
阿里云的“反差”2025:于无声处寻找 ASI
2025年云栖大会上,吴泳铭称实现AGI是确定事件,ASI才是终局。实现ASI需满足两大条件,结合阿里投资计划,阿里云将成企业AI时代支撑者。虽市场份额增长,但利润下降,2025年阿里云极具“反差感”。
OpenAI波兰双雄:GPT不是偶然!再忆奥特曼被逐当天实况
OpenAI宫变时,Jakub Pachocki与Szymon Sidor力助奥特曼翻盘。他们高中相识,因AlphaGo加入OpenAI。ChatGPT并非偶然,是团队深耕成果。二人推动推理模型发展,强调AGI发展中对齐问题重要,要兼顾能力与安全。
5.1K Star!Codebuff 把整个 AI 编程团队装进你的终端!
Codebuff是开源AI编程助手,获超5.1k stars。其多智能体架构让不同智能体分工协作,理解代码上下文更好、编辑更准。官方测试中完成率61%,超Claude Code。它免费且上手简单,还能创建自定义智能体。
哈萨比斯唯一官方传记首度揭秘:曾想让DeepMind脱离谷歌,还准备了一个疯狂的“B计划”
2022年ChatGPT爆发后,谷歌要求DeepMind加速商业化,坚守理想的哈萨比斯为守护独立研发权,策划“赎身计划”,想筹50亿美元脱离谷歌转公益AGI实验室,虽获投资人兴趣但计划流产,展现其在资本与理想间的艰难抉择。
Gemini再揽金牌,力压大学学霸,AI数学推理时代来了!
苏黎世联邦理工学院博士生在大学生国际数学竞赛(IMC)测试了Gemini三种模式,其表现远高于金牌门槛,远超普通大学生。研究人员还从模型输出提取见解,展现了Gemini在数学推理上的优势,凸显AI数学推理能力日益强大。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
沃顿教授警告:老板用AI正偷偷赚钱,而你还在审它做的17份PPT?
AI跨越关键门槛能完成有经济价值的工作,但也可能产生大量无用内容。OpenAI新测试显示大模型进步快,虽暂难取代人类工作,但智能体工作续航能力大增,人类对其使用方式决定未来。
OpenAI高管自爆:Scaling不死,GPT-5「双轴训练」撕开智能天花板
OpenAI首席运营官Brad Lightcap在对话中揭秘GPT-5,其能自主判断是否深度推理再作答,体验全面升级。训练方式有后训练,Scaling Law仍成立,未来从两轴改进。还探讨了AGI、应用场景等。