长上下文模型」共找到 8246 篇相关文章

算法论文8

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克程GUI任务

手机GUI Agent在程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。

量子位
算法论文7

The Batch: 899 | 更划算的推理

研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为上下文推理提供路径。

DeeplearningAI
新闻资讯7

腾讯回应 OpenClaw 之父 Peter 的“抄袭”指责;突发!字节AI视频模型Seedance 2.0发布紧急叫停;Mac mini因“养虾热”断货 | Q资讯

本周AI圈热点不断:腾讯回应OpenClaw之父“抄袭”指责;字节AI视频模型Seedance 2.0发布叫停;Meta或裁员20%;美团王兴谈海外战略与AI冲击;“养虾热”致Mac mini断货;DeepSeek V4和腾讯新混元模型4月将发布。

InfoQ
推荐文章8

他救了OpenAI、年赚过亿、三家明星CTO,却自曝跟不上AI发展了!硅谷大佬告诫:不是马斯克,就别碰大模型

Bret Taylor履历丰富,曾助力OpenAI解决危机。他认为AI市场将分化为前沿基础模型、AI工具层和应用型AI三个板块,不建议普通创业者做基础模型,看好应用型AI中Agent生态。还分享创业、编程等多方面见解。

InfoQ
新闻资讯8

MIT天才博士刚毕业,就被前OpenAI CTO抢走!年薪或300万起步

MIT天才博士肖光烜刚毕业就官宣加盟Thinking Machines,主攻大模型预训练。他履历耀眼,博士论文破解LLM三大难题,构建高效大模型框架。Thinking Machines薪资可观,平均年薪超OpenAI等公司。

新智元
产品应用8

首创双NPU架构一鸣惊人!联发科天玑9500重磅加码主动式AI体验

联发科天玑9500首创超性能+超能效双NPU架构,让AI始终在线,融入用户操作。其输出性能、上下文窗口等有显著提升,还解决了模型加载慢等问题,与多厂商合作推动端侧AI落地。

量子位
算法论文7

姚顺雨入职腾讯50天后,发布了首篇署名论文:CL-Bench

2月3日姚顺雨加入腾讯50天后发布首篇署名论文《CL-bench: A Benchmark for Context Learning》。该论文做了新的benchmark,测试显示前沿模型平均分仅17.2%,指出模型上下文学习尤其是归纳能力上的短板。

花叔
新闻资讯8

Claude Opus 4.7发布!这是你在别的公众号看不到的五个发现

Anthropic发布Claude Opus 4.7,编码和视觉能力提升,但上下文能力下降。其231页的System Card藏着不少有趣发现,如Opus 4.7非最强模型、Claude知道被测试、模型审查自身评估等。

花叔
开源动态7

实测最新开源的DeepSeek-OCR后,我有些不一样的看法,有些话可能只有我敢说

实测最新开源的DeepSeek - OCR,它并非传统OCR,不适用于传统场景。其最大意义是解决大模型上下文度问题,通过文字图片压缩解压提高处理速度。模型功能多样,是让AI看图思考的新思路。

开源AI项目落地
开源动态7

一夜之间,Claude Code删掉了80%系统提示词

本周五,Anthropic 技术团队成员 Thariq Shihipar 介绍新一代大语言模型工程趋势变化。Anthropic 发现旧提示词工程范式在新一代强推理模型发布后或过时,新的 Claude.md 应精简,大砍系统提示词后可把特定任务上下文交给 Skill。

机器之心