多模型攻击」共找到 9699 篇相关文章

新闻资讯7

535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。

InfoQ
开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位
新闻资讯7

现在,最会赚钱的AI是Qwen3!全球六大模型厮杀,Top 2来自中国

模型「炒股」大赛中,阿里Qwen3 Max逆袭DeepSeek夺冠,成「最会赚钱」模型,GPT - 5成「最会赔钱」AI。比赛由Nof1实验室打造,Qwen3 Max成绩体现国产大模型实力。

新智元
推荐文章8

现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了

Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁项功能,评测表现佳,但也存在长会话、计算部署等局限。

AI寒武纪
开源动态8

9B“小”模型干了票“大”的:性能超8倍参数模型,拿下23项SOTA | 智谱开源

智谱发布并开源仅9B大小的模型GLM-4.1V-9B-Thinking,在28项评测中拿下23个SOTA,成10B级别最佳VLM模型。它引入思维链推理机制,通过课程采样强化学习提升能力,还获10亿投资。

量子位
推荐文章7

深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来

本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。

AI科技评论
产品应用8

英伟达帮你省钱,让大模型推理「短而精」,速度快5倍

过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型

机器之心
开源动态7

OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE

OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。

量子位
算法论文7

函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025

中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。

量子位
新闻资讯7

对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能

具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。

AI科技评论