「自主实验」共找到 1788 篇相关文章
突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆
机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026
在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。
重磅!谷歌开放世界模型Genie 3试用:AI实时生成可玩世界,人人都能创造“我的世界”
谷歌开放世界模型Genie 3实验性研究原型Project Genie试用,美国18岁以上Google AI Ultra订阅用户可体验,能创建、探索和重混互动世界,不过Genie 3是早期研究模型,有待改进之处。
只会写代码没戏了!奥特曼最新面试题曝光:1人要干1个团队的活
OpenAI开年首场答疑会,奥特曼坐镇回应关切。他承认团队为追求ChatGPT编程能力,牺牲创意协作能力。还谈及软件工程未来变革、AI成本降低、Agent自主运行等问题,也对众多提问给出看法。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
笑死!xAI员工竟用Claude写代码?这回Anthropic反手拔了马斯克的网线
2026年1月8日消息,xAI联合创始人通知员工,Cursor中的Claude模型无法响应,是Anthropic针对对手的新政策。此前Anthropic已多次调整策略,封杀竞争对手,其目的包括保护数据资产等。xAI或加速自研,行业或开启军备竞赛。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV
上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。
Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16
Sea AI Lab 和新加坡国立大学研究指出,强化学习微调中训练不稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理不匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。