o4模型」共找到 8303 篇相关文章

新闻资讯7

模型全员0分!谢赛宁领衔华人团队,最新编程竞赛基准出炉,题目每日更新禁止刷题

谢赛宁等人出题,让o3、Gemini - 2.5 - pro模型全军覆没。LiveCodeBench Pro是实时基准测试,题库每日更新。此前称LLM编程超人类专家,本次测试并非如此,最好模型难题通过率也为0。

量子位
新闻资讯8

Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞

沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。

InfoQ
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
产品应用8

重磅!iPhone 端侧可部署 Gemma 4 了!完全零token消耗!

PhoneClaw 是运行在 iPhone 的本地 AI Agent,可离线运行 Google Gemma 4。它支持多模态,有隐私保障和灵活模型管理。文中介绍使用方法、自定义 Skill 方式、常见问题,还提及后续扩展计划。

GitHubStore
开源动态8

字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o

字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。

探索AGI
开源动态8

普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B

近日,普林斯顿大学牵头多机构推出开源数学定理证明模型 Goedel-Prover-V2。其 32B 旗舰模型在多基准测试超 DeepSeek-Prover-V2-671B,8B 小模型特定基准性能与之持平。该模型有三项关键创新,团队已公开模型及数据集。

机器之心
新闻资讯8

AI 的下一个战场:端侧模型崛起

模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。

AI科技评论
新闻资讯8

Claude Opus 4.5来了:谷歌把Anthropic逼到了墙角

上周谷歌发布Gemini 3 Pro表现惊艳,今日Anthropic推出Claude Opus 4.5应对。其编程能力强,SWE - bench Verified首超80%,且降价66%。还推出产品更新,开发者可按需选模型

花叔
产品应用8

DeepSeek-V4发布!高效百万上下文智能普惠时代来了

DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。

AIGC开放社区
开源动态7

GLM-4.7-Flash无审查版发布:30B MoE模型,仅3B激活参数

GLM-4.7-Flash无审查版由HauhauCS发布,基于原版移除审查机制。采用30B - A3B混合专家架构,总参数量31B,每次前向传播仅激活约3B参数,推理快,支持200K上下文长度,有两种变体和四种量化版本。

AI工程化