「长度泛化能力」共找到 3408 篇相关文章
1.4K Star!不要问答,要完成任务,一个合格的金融Agent应该是什么样?
过去一年AI Agent火热,但金融场景投研是长链路任务,有诸多硬约束。LangAlpha是Ginlix AI推出的开源金融Agent项目,能解决实际金融研究任务,有核心架构和关键能力,还给出使用方式、典型Demo及横向评测。
硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。
文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。
会挖0-day漏洞!凶残版Claude官宣却不让用,微软苹果齐下场“看守”,Anthropic到底在图什么?
Anthropic官宣Mythos Preview,却未将其放给普通人用,而是塞进防御联盟Glasswing。Mythos在漏洞发现和利用上能力超多数人类,Anthropic怕其引发风险,先将它组织进防守体系,还试图占据‘负责任的frontier lab’位置。
Andrej Karpathy回应强化学习之父Sutton最新观点「LLM是“死路一条”」
图灵奖获得者、强化学习之父Richard Sutton认为当前热门的大语言模型是“死路一条”,因其缺乏从实际互动中学习的能力。AI大神Andrej Karpathy认同其批评,认为当前LLM是向现实妥协的产物,还提出了“幽灵”比喻。
Cursor已死,Claude当立!Anthropic用L4级Agent,正在“降维打击”整个AI编程赛道。
AI编程领域正上演变革,很多用户从Cursor转向Claude Code。Claude Code成本有优势且具L4级编程能力,其强大还冲击了生态。未来Agentic DevOps是黄金赛道,最终赢家或为有顶尖模型与云服务的玩家。
2025 年 AI 编程趋势:智能体 10 倍生产率放大下的“粪围”蔓延
文章指出 2025 年是体系化跃迁起点,AI 编程工具不断升级。AI 代理能力超代码补全,编程从‘代码直生’转向‘计划先行’,自动验证增强,还有异步化、团队协作等趋势。但 AI 重构有问题,还会放大技术债。
印度裔 AI 负责人删掉 Karpathy 90%遗留代码,马斯克 Robotaxi 终上线!用户体验:不要小费,还可能倒给你钱
当地时间6月22日,特斯拉在奥斯汀启动Robotaxi试点服务。其AI团队核心成员是印度裔阿肖克和德国工程师米兰。技术上精简代码、扩展模型上下文长度,用户体验顺畅,但与马斯克此前设想设计有差异,国内也有多家企业开展此业务。
Claude Code与Codex六大组件拆解
文章指出如今如GPT - 5.6等模型的裸能力相近,但装进Claude Code 或 Codex CLI 后表现差距大,原因在于Agent Harness。它将编码智能体拆解为六个核心组件,详细阐述各组件作用与意义。
AI邪修时刻!Meta联手MIT投毒,左脚踩右脚强行升天
Meta的SOAR架构用错误率高的数据让模型推理能力暴涨9.3%。它选难题子集,用‘教师模型’生成含错题的‘垫脚石问题’,通过‘双层博弈’和‘有根奖励’机制让模型进步,或成AI进化新方向。
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
谷歌等机构研究指出,推理模型能力提升源于‘思维社会’,即模拟类多智能体交互结构。如 DeepSeek - R1 等在推理中展现高视角多样性,对话特征能提升推理准确率,还提出利用‘群体智慧’新方向。