「推理能力评测」共找到 4913 篇相关文章
同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生全模态文心5.0
2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生全模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
神秘模型「牛来」真身曝光,是智谱刚开源的 GLM - 5.3 Flash,为 5 系列首个原生多模态模型。它尺寸小能力强、价格低,用国产卡,实测多模态和 Coding 能力出色,架构全新,开源后将模型、算力和生态结合。
超越GPT-4o和Gemini 2.5!小米MiMo-Audio音频大模型真香
小米推出MiMo - Audio大模型,预训练数据超1亿小时。它在多个基准测试成开源7B模型SOTA,开放相关资源。分词器表现佳,有全新架构,在音频理解、对话、推理等方面表现出色,还集成TTS功能。
他们还没毕业,就在用AI搭建自己的世界|五源小酒馆Vol.30 x AI Native创造者
本期五源小酒馆邀请三位年轻AI Native创造者,分享AI学习与创造经历。他们谈及AI对生活工作的改变、关注的产品及模型,探讨资源分配、AGI突破等问题,还交流了未来能力培养和给十年后自己的话。
AI 时代的人们,正在两极分化
文章指出人们对AI的认知正出现巨大裂缝,Karpathy将人分为两拨,一拨用免费版ChatGPT后认为AI不过如此,另一拨花高价订阅前沿模型感受其惊人进步。不同用户群体使用的AI能力代差大,还提及使用时长维度。
DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
Agent 进入日常研发流程后,使用方关注耗时、Token 消耗和失败回溯。DeepSeek Harness(DSH)是开源 Agent 框架,腾讯云 Agent 可观测提供 DSH 采集插件,构成全景可观测方案,还介绍接入实践与其他能力。
AI安全得查祖宗三代?Anthropic登Nature揭秘大模型潜意识传染
Anthropic论文登上Nature,揭示AI模型仅通过纯数字序列就能继承另一模型的危险偏好。研究表明,即使删掉敏感词,隐性信号仍能传递,且代码和推理链也是传染通道,这对AI安全评估提出新挑战。
DeepSeekV3.2技术报告还是老外看得细
ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。
首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!
上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。
函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025
中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。