新架构」共找到 4965 篇相关文章

开源动态8

Qwen3-Next:迈向更极致的训练推理性价比

文章发布Qwen3-Next架构及Qwen3-Next-80B-A3B系列模型,通过混合注意力等改进提升训练推理效率。介绍模型结构、性能优势,还说明使用方法,包括在多平台部署及处理超长上下文,展望持续优化架构

通义千问Qwen
开源动态8

6.1B打平40B Dense模型,蚂蚁开源最MoE模型Ling-flash-2.0

蚂蚁百灵大模型团队开源 MoE 大模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到平衡,为大模型‘参数膨胀’提供路径,还在多领域应用表现出色。

机器之心
新闻资讯7

Token 译名:「智元」

文章讨论Token译名「智元」,认为其比「词元」更合适。介绍英伟达GTC 2026上黄仁勋强调AI推理时代智元重要性,OpenClaw消耗大量智元引争议,还提及黄仁勋闭门会观点及多位大佬对「智元」译名的认可。

新智元
新闻资讯7

xAI解散,但Grok还在上,马斯克官宣模型

xAI 解散、大批成员离职后,马斯克透露 Grok 最模型进展,参数量 1.5T 的 Grok V9 - Medium 已完成训练,预计两到三周内发布。他还宣布现有 0.5T 模型年底前开源,此外首款编码智能体 Grok Build 也备受关注。

机器之心
算法论文8

大模型破译甲骨文创下SOTA!复旦团队推出框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。

量子位
算法论文8

大模型破译甲骨文创下SOTA!复旦团队推出框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,还能为未破译甲骨文输出可解释分析文本,助力考古工作。

量子位
算法论文7

高效Agents的尽头是,Harness

文章指出玩Agent久了会出现问题,很多人简单将其视为“模型+工具”组合远远不够。以OpenDev为例,介绍了Harness架构,包括核心理念、扩展ReAct循环、上下文工程等,还提及安全架构、多模型路由等内容。

PaperAgent
开源动态8

DeepSeek开源模型,提出上下文光学压缩:LLM的记忆方式

DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。

花叔
产品应用7

米哈游蔡浩宇,发了个“游戏版ChatGPT”

米哈游蔡浩宇上AI聊天软件AnuNeko,用户反馈其人性化高但逻辑较弱。AnuNeko出自蔡浩宇公司Anuttacon,该公司此前还推出实验性AI游戏。如今AI+游戏大势所趋,米哈游游也加入更多AI元素。

量子位
新闻资讯7

H-1B正在筛掉「下一个英伟达」?

美国政府公布H-1B签证规,将申请费用提至10万美元,还提高工资门槛。英伟达CEO黄仁勋支持但担忧,认为费用或抑制初创企业、削弱美对人才吸引力,也有教授反对规。

新智元