超长上下文测试」共找到 2297 篇相关文章

开源动态7

惊讶!!!3.2 万 Star OpenViking,让你的原地起飞!!!

OpenViking有3.2万Star,它把记忆、文档、提示词等上下文统一成可浏览地址空间,设计三层信息按需加载,检索留轨迹,还接入多种工具。不过它处Alpha阶段,用前要考虑许可证。

小华同学ai
开源动态7

任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践

文章聚焦 TencentDB Agent Memory 的团队记忆实践,从组织协作现状出发,阐述其原理、结构、构建方法,通过多方面测试验证其价值,提炼出设计原则,指出其核心是治理系统,目标是提升协作带宽。

腾讯技术工程
推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区
新闻资讯7

GPT-5.2降智遭全网差评!奥特曼慌了

OpenAI推出GPT - 5.2,却未打赢谷歌。第三方数据显示Gemini 3 Pro更优,GPT - 5.2在多项基准测试表现不佳,可信度不如GPT - 5.1,遭开发者吐槽。OpenAI为此调整策略,但仍处被动。

新智元
新闻资讯7

OpenAI 盲测新模型不如 Nano Banana Pro?曝 Altman 要暂停 Sora,死磕 ChatGPT

近日,网友发现 Notion 或在测试 GPT - 5.2。OpenAI 盲测新图像模型‘Chestnut’和‘Hazelnut’,结果接近 Nano Banana Pro,但生成图未获好评。Altman 调整战略,暂停 Sora 死磕 ChatGPT,本周将推 GPT - 5.2。

InfoQ
新闻资讯8

刚刚,Claude Sonnet 4.5重磅发布,编程新王降临!

北京时间今天凌晨,Anthropic发布Claude Sonnet 4.5,被定义为全球最强代码模型。它在多方面有显著突破,Anthropic还对全线产品更新,其在多项测试表现出色,且对齐性更好、更安全。

新智元
新闻资讯7

直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?

为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。

深度学习自然语言处理
开源动态8

陶哲轩转发!DeepMind开源「AI数学证明标准习题集」

DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。

量子位
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。

量子位
产品应用8

DeepSeek-V3.1 发布,官方划重点:Agent、Agent、Agent!

2025年8月21日,DeepSeek V3.1正式发布。它采用混合推理架构,支持双模式,网页端、App、API均升级,上下文拓展至128K。其智能体能力增强,思考与输出效率提升,还具备API新特性,模型已开源,价格也将调整。

Founder Park