「大模型评估」共找到 9370 篇相关文章
Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录
扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。
消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告
面壁智能联合多方发布MiniCPM-o 4.5技术报告。该模型是业界首个端到端全双工全模态大模型,参数约9B,依托Omni - Flow框架,多项性能对标前沿大模型,还推出多种使用方式,兼顾普通用户与开发者需求。
万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!
蚂蚁集团发布全球首个开源混合线性架构万亿参数模型Ring - 2.5 - 1T,打破深度思考牺牲推理速度和显存的‘不可能三角’。还同期发布扩散语言模型LLaDA2.1和全模态大模型Ming - flash - omni - 2.0,想做成可复用底座。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
感谢 OpenClaw,国产大模型终于知道怎么挣钱了
OpenClaw作为免费开源项目,重新定义Token消耗量级,催生‘超级Token耗散场景’,倒逼模型厂商推出‘Token Plan’。多家国产模型厂商跟进推出‘龙虾套餐’,云平台也下场布局。但OpenClaw面临配置门槛、任务稳定性和必用场景等问题。
英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来
英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。
抢先李飞飞!世界模型能多人联机玩FPS游戏了
Odyssey公司推出世界模型Agora - 1,驱动网页版多人FPS游戏,无游戏引擎等,画面实时生成。该公司专注通用世界模型,此前业务转向主动交互,此成果解决多人游戏一致性难题,还发布多模态模型Starchild - 1。
开源Agent模型榜第一名,现在是阿里通义DeepResearch
阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。
AgentAuditor: 让智能体安全评估器的精确度达到人类水平
LLM智能体进化为“行动派”,但自主权带来安全问题。现有评估基准缺乏有效精准评估器,研究者推出AgentAuditor框架及ASSEBench基准,让LLM评估器精确度达人类水平,为构建可靠智能体提供工具。
一夜之间OpenAI神秘模型“o3-alpha”刷爆时间线:远胜 Claude Sonnet
OpenAI神秘新模型“o3-alpha”正在测试,刷爆时间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。