「大模型V4」共找到 9296 篇相关文章
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。
利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿
今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!
Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。
推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API
大语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。
MiniMax M2 发布即爆,拿下开源模型第一名
10月27日,MiniMax发布新一代文本大模型M2及由其驱动的MiniMax Agent。M2是专家混合模型,参数达230B但激活仅10B。它在开源模型评测中夺冠,能低成本、高速度支撑工作流,开发者评价高。
CVPR 2026 | AI寒武纪时刻?字节世界模型新作,仅靠视觉学习真实世界知识
豆包大模型团队与北京交通大学联合提出视觉世界模型 “VideoWorld 2”,无需依赖语言模型,仅靠视觉信息让机器掌握复杂能力。它能完成复杂手工任务,成功率远超主流模型,代码与模型已开源。
AI圈深夜大乱斗!OpenAI、谷歌、Anthropic发布新模型,集体翻车?
昨晚,OpenAI时隔六年再次开源`gpt-oss-120b`和`gpt-oss-20b`,Anthropic发布`Claude Opus 4.1`,Google发布Genie 3及写故事书功能。不过OpenAI新模型幻觉率高,Anthropic更新提升有限。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
从今天起,开源前五,全!是!中!国!大!模!型!
短短一年,LMArena开源模型榜单前五全被中国大模型占领,智谱Z.ai登顶,阿里、DeepSeek等紧随其后。LMArena是权威评测平台,盲测机制保证排名真实。中国模型性价比高,正用开源和低价占领市场。