新闻资讯7
MiniMax研讨会:长上下文与混合架构成焦点
Founder Park
AI 摘要
MiniMax技术研讨会指出,RL在有限上下文下能赋予模型新能力,只在数学和代码上训练易致幻觉,长上下文是Agent变革点,混合架构将成主流,还分享推理实践及M1相关问题解答。
阅读原文 · Founder Park
MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer
MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
DeepSeek缓存涨价11倍,开发者需提命中率
8月17日,DeepSeek V4 Pro API输入和输出价格上涨,空闲时段缓存命中价涨5倍,高峰时涨11倍。此前其因高缓存命中率成性价比之选,但长上下文需求爆发致后端“缓存颠簸”,只能通过涨价收“存储税”。开发者可提高缓存命中率应对。
AI科技评论
算法论文8
COLM三篇论文暴击Transformer祖传设计
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
量子位
新闻资讯7
Anthropic的Claude模型升级后问题频出
Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、长上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。
AI科技评论
产品应用8
DeepSeek-V4-Pro正式版发布,Agent能力跃升
8月13日晚,DeepSeek-V4-Pro-0813正式版发布。此次升级将Agent维度提升至无短板的第一梯队,具备1M+384K长任务能力,接口双兼容,技术创新多。还公布评测对比、价格并发设定,给出实战代码案例与启示。
机器学习AI算法工程