大模型发布潮」共找到 10161 篇相关文章

开源动态8

2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
开源动态7

提示词注入攻击的检测和数据集介绍

提示词注入攻击是攻击者操纵AI系统的技术,OWASP将其列为2025年模型应用风险首位。Meta发布测试数据集,还有多个工具和数据集可用于评估。防护可用AI防火墙,Meta开源小模型。还提到安全性与实用性权衡。

AI与安全
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
开源动态8

训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数模型训练打造的系统工具包

上海期智研究院联合算秩未来在WAIC 2025发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四模块解决训练难题。

AI前线
算法论文8

设计师解放!清华发布「建筑平面图」自动生成模型 | ACL'25

清华学吕帅团队提出FloorPlan-LLaMa模型,采用自回归生成架构与RLHF机制,解决传统平面图自动生成模型‘指标优秀但实际不可用’痛点,提升生成式平面图设计质量与实用价值。该论文被ACL录用获领域主席奖。

新智元
算法论文8

MIT新研究:模型加噪声就能替代GRPO/PPO调参

MIT新论文提出,预训练模型周围存在量“专家模型”,只需添加高斯噪声并集成,性能就能比肩甚至超越GRPO/PPO等调参算法。由此启发了RandOpt算法,经测试准确率不错,但也有依赖预训练等缺点。

量子位
算法论文8

好看不等于会交互!阿里发布基于交互的世界模型基准

阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。

AIGC开放社区
新闻资讯7

一个提示攻破所有模型,OpenAI谷歌无一幸免!

HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。

新智元
新闻资讯7

谷歌前CEO施密特:中美模型之间存在一个显著区别

7月26日世界人工智能会上,谷歌前CEO埃里克·施密特与沈向洋对话,指出过去两年中国AI技术进步巨。他认为中美领先AI模型有显著区别,中国部分模型开放权重,美国多数领先模型封闭。他期待中美合作应对AI变革。

AIGC开放社区