MSB安全基准」共找到 1746 篇相关文章

新闻资讯7

GPT-5.2发布即降智?背后华人被挖出,清北校友核心贡献

OpenAI发布GPT - 5.2,官方称其基准测试碾压Gemini 3 Pro,擅长完成有经济价值任务。但发布后实测有翻车情况,也有提前测试者称其很强。此外,背后多位核心贡献者为华人,如北大校友Yu Bai等。

新智元
产品应用8

阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有

阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。

AIGC开放社区
算法论文8

腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」

腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。

机器之心
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务基准上超越顶尖闭源模型,还具备体系化技术创新。未来将持续开源,打造更懂科学的AI助手。

GiantPandaLLM
新闻资讯8

a16z 合伙人:AI 正将 10 倍工程师“降级”为 2 倍!应用层已无技术护城河,未来在基础设施和业务深耕

Andreessen Horowitz (a16z) 的合伙人 Martin Casado 在对话中指出,当前AI大模型竞争格局似当年云计算大战,寡头垄断将降临。他还谈到AI对开发者、投资决策、市场格局的影响,以及对AI安全、开源等问题的看法。

AI科技大本营
开源动态8

碾压DeepSeek V3!阿里开源新版Qwen-3,屠榜级断层第一

今天凌晨1点,阿里巴巴开源Qwen3系列新版本Qwen3 - 235B - A22B - 2507。它是非思维推理的指令微调模型,性能强劲,在多类测试基准中大幅超DeepSeek开源的新版V3 - 0324及月之暗面的kimi - k2。

AIGC开放社区
新闻资讯7

刚刚,OpenAI正式发布o3-pro!奥特曼激动更新博客:温和的奇点

今日凌晨,OpenAI发布o3-pro,Pro订阅用户可通过ChatGPT和API使用。其在多项任务表现出色,但在ARC-AGI数据集上与o3相近且成本高。网友测试评价不一,此外OpenAI CEO奥特曼还发表博客展望AI未来。

机器之心
推荐文章7

618想换电脑跑AI?先听我一句劝。

文章围绕618换电脑跑AI展开,分析了本地跑AI的情况,包括不同模型对算力和显存的要求,指出本地跑的好处是隐私安全、无限免费,还推荐了不同预算的笔记本,为想换电脑学AI的人提供参考。

数字生命卡兹克
推荐文章7

AI Agent时代的「AWS」:Manus 背后的重要功臣 E2B 是何来头?

文章介绍 E2B 这一开源基础设施,它为 Manus agent 提供虚拟电脑支持,允许在云端安全沙盒运行 AI 生成代码。其沙盒月创建量一年增 375 倍,CEO 目标是成 AI Agent 时代的 AWS,还探讨了 AI Agent 相关问题。

Founder Park
算法论文8

GPT-4V仅达Level-2?全球首个多模态通才段位排行榜发布,General-Level打造多模态通用AI评测新范式

General-Level团队提出全新评测框架General-Level和数据集General-Bench,构建超大规模评测基准和多模态通才模型排行榜。其用五级段位体系衡量模型通才能力,General-Bench覆盖多模态任务,排行榜分多层次榜单,目前各模型段位差异大,Level-5空缺。

量子位