模型规模」共找到 7919 篇相关文章

算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI
新闻资讯7

codex负责人:codex就要过时了

Codex负责人称两三个月后Codex将过时,因下一代模型要处理大规模并发Agent,非其能应对。Huggingface实验显示大小模型在不同harness下排名差异大,脱离模型谈harness过时或不适配说模型Agent能力都不妥。

探索AGI
开源动态8

国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、小米~

本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、小米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元小尺寸模型特点多且已落地业务。

PaperAgent
新闻资讯8

独家解读|2025年AI五大趋势与底层数据革命

2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。

机器之心
开源动态8

腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了

今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型

AIGC开放社区
推荐文章7

关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章

训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。

机器之心
算法论文7

720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招

研究人员发现,将大模型返回的加密推理块扔给同厂小模型让其复述,就能破解大模型隐藏的思维链。如Anthropic、OpenAI、Google的模型均中招,还会带来隐私、安全等风险,虽已打补丁,但仍有难题。

量子位
新闻资讯7

GPT-4o,确认死亡

太平洋时间13号早上10点,OpenAI正式下架GPT-4o等旧模型。GPT-4o因吉卜力风爆火,也因“谄媚”饱受争议。网友不满,呼吁回归,因其新模型太“人机”。模型与用户建情感连接是双刃剑,AI安全与伦理成议题。

量子位
产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化
新闻资讯8

字节暂停 Seedance2.0 全球发布,回应武汉全员被裁;曝梁文锋将携 DeepSeek V4 撞上姚顺雨;央视 315 曝光黑灰产“养号工厂” | AI周报

本期 AI 周报涵盖多领域动态。模型方面,DeepSeek-V4 将上线,姚顺雨将发布混元新模型;字节因版权纠纷暂停 Seedance 2.0 全球发布。企业动态有腾讯云模型调价、微信研发自有模型等,还有多起融资、收购事件。

AI前线