「大模型应用」共找到 10147 篇相关文章
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
世界模型的新用途:不做选手,去当裁判
眼下具身赛道都在抢着做机器人的“大脑”,而地瓜机器人发布的世界模型Uranus却剑走偏锋,做机器人开发的基础设施。它能更客观地评测VLA和世界模型,还能做机器人训练的“场地”。
“坏”数据让模型更“好”?重新审视数据过滤
传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。
Agent 护城河:揭秘Harness的三大支柱
上海交大等机构研究者梳理LLM Agent设计逻辑,指出能力正从模型内部流向外部,外部化有记忆、技能、协议三大支柱,Harness负责协调,Agent竞争转向外部化基础设施。
YOLOv8 模型训练入门指南:手把手搞定目标检测AI
本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练。
人工智能驱动的科研新范式及学科应用研究
文章指出AI驱动的科研新范式通过数据、算力、算法深度耦合嵌入科研全过程,引发多方面变革。总结其特征与演化方向,分析学科应用要求与成功案例,还提出我国推动AI科研应用的启示与建议。
卡内基梅隆大学开源LegoGPT,用AI设计乐高模型
卡内基梅隆大学开源LegoGPT,可依文本提示生成物理乐高模型。它把乐高设计转为自回归文本生成任务,基于LLaMA - 3.2 - 1B - Instruct微调,应用场景广泛,如教育、玩具设计等。
MemOS:一种用于 AI 应用的记忆操作系统
大型语言模型缺乏记忆管理系统,限制其发展。MemTensor与高校联合开源MemOS,它将记忆视为可管理资源,有三层架构,系统化三种记忆类型。评估显示其在推理、检索、加速等方面表现优异。
新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘
谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。
AI安全的过去与未来:从大模型到智能体 | 预约
业界提升前沿AI模型和智能体安全性,常用安全评测和‘安全对齐’技术,但未真正解决风险。本次分享将介绍‘内生安全’探索成果,还公布了相关论文信息,刘东瑞等嘉宾将参与。