「MiniMax M3」共找到 2206 篇相关文章
谷歌用Gemini 3同时革了OpenAI和英伟达两家的命
谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。
DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO
论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。
MiniMax Agent 开年更新,好的 AI 产品,需要让工具来适应人了
2026年初,Claude Cowork引发关注,开源社区跟进,Anthropic下调功能价格。MiniMax升级Agent,推出桌面端和网页端新功能。通过整理文件、翻译、小红书内容流水线等测试,展现其能力与局限,指出Agent应适应人的趋势。
Anthropic求锤得锤!Mythos 2被曝雪藏,Mythos 3正秘密研发
SemiAnalysis内部播客爆料,Anthropic新模型Mythos 2训练完成却被雪藏,正用其生成数据研发Mythos 3。Anthropic曾呼吁监管,如今自食其果。此外,OpenAI的Astra也因安全问题暂停部分活动。
10万token自然语言推理,让30B-A3B模型站上奥赛金牌线
上海人工智能实验室报告显示,30B - A3B规模的SU - 01模型不依赖外部工具,经训练在IMO、USAMO、IPhO等奥赛评测达金牌水平。研究还验证更高效科学推理系统路线,有望用于更多科学问题。
Qwen 3.5 的口碑持续走高,林俊旸辞职出走,开源阵营震荡
3月4日,通义千问首席研究员林俊旸宣布辞职,多位核心骨干也一同离开。此前Qwen 3.5系列开源表现出色,此次人员变动引发社区震动。大厂战略与技术路线拉扯,人才流动成常态。
Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率
Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?
4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。
线性注意力回归!Kimi新模型引爆,MiniMax却悄悄换回传统架构
LLM领域线性注意力机制正在回归,工程实践主要由国产模型推进。早期线性注意力因牺牲精度未获主流认可,今年下半年多个国产模型采用其变体,MiniMax却又换回传统架构,Kimi新模型带来新解法。
Claude半个月连崩7次!全球宕机3小时,强制实名精准封号
Claude半个月内7次大规模故障,全球宕机3小时,开发者破防。原因是Anthropic算力储备告急,为自救拟自研芯片。此外,Anthropic还通过改定价、加闸、实名验证等措施控制成本。