「形式化验证系统」共找到 2421 篇相关文章
Anthropic 推出 MCP 隧道,供私有代理访问内部系统
Anthropic扩展Claude Managed Agents平台,推出自托管沙箱和MCP隧道功能。自托管沙箱公测,支持多服务商运行工具;MCP隧道处研究预览,可让代理连私有MCP服务器,满足企业管控需求。
今年看到最系统的AI Agents时代Memory综述~
分享由NUS、人大等联合出品的《Memory in the Age of AI Agents: A Survey》。用三维框架讲透200+篇论文,提出新三大记忆形态,展望7大前沿,还涵盖记忆各方面知识及资源。
张小珺对话OpenAI姚顺雨:生成新世界的系统
OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。
生成式推荐!推荐系统新范式还是新噱头?
文章围绕生成式推荐展开,介绍其概念,探讨效果和成本问题。以Meta的GR和快手的OneRec为例,分析收益与开销,指出不同团队应用情况,认为它或带来架构革新,也提醒勿盲目跟风。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。
解密 Cursor:一位深度用户的原理探析与实验验证
文章作者作为 Cursor 付费用户,通过实验分析其与大模型通信机制和设计原理。用 OpenAI 的`gpt - 4o`模型做实验,发现它是‘基模 + 若干工具’组合,也指出在真实项目因上下文不足表现不佳。
让 Coding Agent 开始「记住过去」:MemoraX Code 的长期记忆系统
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。
不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格
陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。
从 Prompt 到 Context:基于 1400+ 论文的 Context Engineering 系统综述
本文围绕Context Engineering展开,介绍其定义、与Prompt Engineering区别,从LLM OS视角说明其重要性,指出context处理不当的问题,对其分类及处理管理过程进行探讨,还提及面向LLM Context开发的变化。