「Gemini - 2.5 - Pro」共找到 3685 篇相关文章
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。
Anthropic让9个Claude Agent花5天做出比人类强4倍的对齐成果
Anthropic发表Automated Weak - to - Strong Researcher,用9个并行的Claude Opus Agent组成自动化研究团队,5天就把PGR从人类的0.23提升到0.97,成本约$18,000,证明AI自动化研究可行。
奥特曼深夜「放鸽子」!不发GPT-5,竟是给7亿用户「防沉迷」?
万众期待的GPT - 5未发布,OpenAI在ChatGPT周活破7亿时公布「防沉迷」新理念。这体现其「助你成事」目标,还对ChatGPT进行多项调整,且与全球专家合作提升其响应能力。
终于!OpenAI 开源了2款模型:gpt-oss-120b 和 gpt-oss-20b
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 开源模型,性能出色,如 120b 版本媲美 o4-mini,20b 版本能在笔记本甚至手机运行。采用 Apache 2.0 许可证,有多种特性与运行方式,还经安全分析。
全球首款120通道PCIe5交换芯片面世,为国产AI基础设施赋能
随着AI算力需求增长,芯动科技推出全球领先的104/120通道PCIe Gen5交换芯片。该芯片功能及性能全面对标国际行业龙头,可适配全场景应用,其落地标志国产高端PCIe交换芯片实现关键跨越。
AI子弹已上膛!OpenAI斩获美国防部2亿美元大单,密谋向微软「开枪」
AI巨头权力洗牌加速,OpenAI与微软因收购Windsurf及股份问题关系紧张,甚至考虑反垄断指控。同时,OpenAI获美国防部2亿美元合同,有「OpenAI for Government」计划,还致力于建设算力设施。
最强协作模型?MiniMax M2.7 实测:AI开始更会合作了 | Claude Teams
MiniMax M2.7模型发布,强调模型自我进化、Agent Harness和Agent Teams。它能构建复杂Agent Harness,完成高难度生产力任务。其能力达国际一线水平,在多测试中成绩优异。还介绍了Harness、Agent Teams等概念及应用场景。
Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。
仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架
阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据自进化新路径。
马斯克掀桌子了,最强开源大模型诞生!Grok-2近万亿参数性能首曝
xAI官宣向所有人开源Grok - 2,其有9050亿参数、128k上下文窗口等强大技术规格。还梳理了开源部分、技术特点、权限等,介绍使用方法,网友和大佬高度评价,马斯克预告后续计划。