「OpenAI MLE - Bench」共找到 1988 篇相关文章
中国模型打服硅谷:Airbnb联创CEO感叹又快又好又便宜!把ChatGPT合作都拒了
当OpenAI为ChatGPT造势时,中国模型凭实力圈粉老外。爱彼迎CEO称依赖阿里Qwen,因其又好又快又便宜;Kimi K2性能碾压闭源模型;DeepSeek创新成果获多方称赞,中国模型在全球AI竞赛中走出独特路径。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪
2025年AI迈向ASI,新智元迎十周年,9月7日将在北京举办峰会。众多大咖齐聚,探讨芯片、大模型等前沿突破。今年大模型发布密集,如OpenAI、谷歌等有新成果,中国造大模型也表现出色,未来智能体等将爆发。
凌晨,Qwen又更新了,3090就能跑,3B激活媲美GPT-4o
Qwen凌晨更新,Qwen3 - 30B - A3B有新版本Qwen3 - 30B - A3B - Instruct - 2507。仅激活3B参数,实力媲美谷歌Gemini 2.5 - Flash和OpenAI的GPT - 4o,在多项测试中提升显著,已在魔搭社区等平台开源。
为什么 DeepSeek 大规模部署很便宜,本地很贵
文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。
Agent大革命!Claude 4连续自动编程7小时,刷新世界记录
今天凌晨Anthropic召开开发者大会,发布Claude 4,含Opus 4和Sonnet 4。Opus 4编程智能体连续工作7小时破纪录,Sonnet 4在SWE - bench表现超前沿模型。还新增功能,Claude Code开放,API也有新特性,Sonnet 4免费但有限制。
《TAML》好文推荐 | 来自中国科学院力学研究所张磊博士 评估大语言模型在计算流体力学领域的知识利用、学习与创造
研究聚焦评估推理型(DeepSeek R1和OpenAI o3 - mini - high)与非推理型(DeepSeek V3和ChatGPT 4o)大语言模型在计算流体力学领域知识利用、学习与创造能力。通过三类基准问题评估,结果有差异。
Sam亲自泼冷水,GPT-5意外失手:我们对AI的期待,是否已被整个行业误判?
科技行业集体转向 AI,高管强调其变革性,可 OpenAI 的 Sam Altman 却泼冷水,提醒投资者高估回报。文中围绕‘AI 是否放缓’展开讨论,还分析了 GPT - 5 发布遇冷原因、AI 对就业影响等,指出 AI 发展多且快,未来潜力巨大。
硅谷精英放弃生娃!MIT女记者揭秘:人类只是AI垫脚石,世界很快就毁灭
华人女记者Karen Hao出版《AI帝国》,揭露OpenAI背后隐秘真相。书中提到部分AI行业技术高管因认为世界不久将不复存在而选择不育,还讲述了AI带来的诸多问题,如资源消耗、道德困境等,也指出AI公司拒绝承担现实成本。
小扎万字檄文炮轰硅谷,Meta重磅开源30B小钢炮!一台MacBook就能跑
Meta发布全新30B大模型Muse Glimmer并开源,用4-bit量化等技术让其能在本地设备运行,有五大核心超能力且采用Apache 2.0协议。同时,Meta CEO小扎发表万字檄文暗讽OpenAI等,抨击AI末日论等观点。