「超长上下文测试」共找到 2300 篇相关文章
Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?
Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。
MIT这篇RLM论文,给出了Scaling的另一种可能~
当大家普遍认为解决长上下文问题要靠扩大模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意大语言模型处理 10 万 +token。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
担心被曝“于谦门”,57岁的于谦到底用龙虾做了什么?
于谦视频播客《多新鲜呐》最新一期,本质是“AI产品用户体验公开测试”。于谦作为测试员,关注点在结果、省事、风险等,节目把技术叙事换成生活叙事,帮AI面向大众转译。
刚刚,Grok 4发布,「人类最后的考试」中拿下50.7%,碾压所有对手,游戏结束?
Grok 4发布并对X Premium+订阅者开放。它是领先的AI模型,人工智能指数超对手,全方位性能爆表,还具备实用功能。在「人类最后的考试」拿下50.7%,显示AI智能增长无上限。
推出4个月就狂赚3亿?!百万用户应用CTO弃Copilot转Claude Code:200美元拯救我的137个应用
Anthropic 公司推出的 AI 编码助手 Claude Code 推出 4 个月吸引 11.5 万开发者,单周处理 1.95 亿行代码,年化收入预估达 1.3 亿美元。开发者认为它优势明显,Soham 级别的生产力,还分享使用技巧。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
给Agent加上知识图谱,开源版Palantir
Semantica是LLM、向量库与Agent框架下的语义/上下文层,能把碎片化企业数据变成结构化、可查询的上下文图与知识图谱。介绍了其面向对象、功能、优势、使用方法、架构等内容。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
Claude Code没有“魔法”
资深工程师 Daisy Hollman 在演讲介绍了 Claude Code 插件设计与上下文工程原语,以及 Anthropic 内部多 Agent 工作流。指出定制模型可放大能力,上下文窗口是关键,还探讨多种插件抽象与工作流扩展方式。