「有状态推理」共找到 7617 篇相关文章
用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA
如今强化学习在多领域成果显著,但在长跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于时序差分的强化学习,解决探索效率和值传播问题,实验表现优异。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
vLLM 技巧: 在几秒钟内无需重启释放90%的 GPU 显存
EmbeddedLLM介绍vLLM新功能“休眠模式”,可在不重启服务时几秒内释放约90% GPU显存,实现模型热插拔与高效轮转,还介绍使用方法、不同休眠级别,提醒生产环境要确保安全。
Manus跑路了吗?
4个月前爆火的AI Agent产品Manus,被曝裁掉国内七成团队,总部迁至新加坡。官方称是基于经营效率考量调整业务。Manus自3月上线后动作不断,其核心力量大迁徙或因海外生态更成熟、国内付费习惯弱。
未来,你的 Agent 怎么付钱?
借 a16z 文章,探讨 Agent payment 领域进展。实现 Agent 自主支付是未来关键方向,现已有迹象且部分企业推出解决方案,但 Agent 处理支付尚未真正自主,还面临角色范围、欺诈、责任归属等难题。
16 年老程序员用 Claude Code 搞副业:我只手敲了 1000 行,剩下 95% 代码靠自动生成
Anthropic公司的AI编码助手Claude Code推出4个月吸引11.5万开发者,单周处理代码量达1.95亿行,预估年化收入约1.3亿美元。开发者Indragie用其构建macOS应用,2万行代码中手写不到1000行,还分享使用技巧与体验。
刚刚,为对抗哥大退学生开发的AI作弊器,哥大学生造了个AI照妖镜
Cluely是款备受争议的AI桌面助手,能替人参会。哥伦比亚大学学生开发反Cluely工具Truely,检测通话是否为真人。其原理是检测对方设备PID,不过使用较繁琐。同时,Cluely起诉公布其提示词的人。
彻底戳穿AI「失忆症」!超越OpenAI全局记忆,中国队开源LLM记忆操作系统
大语言模型有「记忆」缺失问题,国内顶尖团队打造出操作系统级AI记忆框架MemOS并开源且可商用。它将「记忆」升为「一级资源」,用MemCube封装记忆,评测显示性能优于OpenAI全局记忆方案。
原来Scaling Law还能被优化?Meta这招省token又提效
2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta新论文提出旋转不变型三线性注意力机制,证明其表现能改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。
野生DeepSeek火了,速度碾压官方版,权重开源
近日,德国AI咨询公司TNG推出的「DeepSeek R1T2」模型火了,速度比R1快20%,性能不弱于R1。它采用AoE技术,融合官方三大模型,开源且在Hugging Face开放权重,获不少人期待。