「上下文自适应」共找到 744 篇相关文章
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。
谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、多模态、MCP全支持
谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力多样,涵盖代码理解等,支持百万上下文、多模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。
Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。
Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。
推特热议、AI 万亿美元新赛道,「上下文图谱」到底是什么?创业机会在哪?
文章围绕「上下文图谱」展开,探讨其定义、构建问题及创业机会。指出它是决策轨迹积累形成的结构,构建要解决双时钟等问题。大厂难以捕捉决策轨迹,初创公司有三条路可走,捕捉决策轨迹或成新万亿级平台。
腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合
腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。
剪映前AI产品负责人创业多模态Agent,做懂上下文的007乙方,成立半月融资数百万美元
剪映前AI产品负责人廖谦创业,成立极致上下文公司,获数百万美元投资。公司首要打造面向营销场景的多模态Agent,中长期搭建AI信息表达系统,他认为当下是创业好时机,且无传统意义上的护城河。
上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了
最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。
腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合
日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。
大模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升
本文从中兴通讯无线研究院「大模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。