「大语言模型解毒」共找到 7896 篇相关文章
陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」
OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
2025 IMO真题撕碎AI数学神话,全球顶尖模型齐翻车!冠军铜牌都拿不到
2025 IMO数学竞赛中,全球顶尖AI模型均翻车。冠军Gemini 2.5 Pro仅得31分,连铜牌都拿不到。Grok - 4表现糟糕,DeepSeek - R1也令人失望。AI虽有思路,但逻辑细节不足,离成奥数大师尚远。
突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达
OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为大语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。
刚刚,苹果WWDC掀AI重构风暴!端侧模型全开放、AI版Siri却成最大「鸽」王
北京时间今天凌晨,苹果全球开发者大会 WWDC 召开。苹果宣布系列系统更新,展示 AI 融入产品计划,开放端侧大模型,推 Xcode 26。但增强版 Siri 跳票,股价下跌,网友不满。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。
谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站
谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。
TypeScript 之父 Anders Hejlsberg:别折腾“AI新语言”了,真正变天是 IDE 让位给 Agent
TypeScript 之父 Anders Hejlsberg 在与 GitHub 研究顾问对谈中回应质疑,称选 Go 重写编译器合理。他认为 AI 编程时代,TypeScript 语言服务将重塑,IDE 或让位给 Agent,还谈到 AI 在代码迁移中的应用及开源可持续性问题。
Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B
Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。