「网络生存测试」共找到 2017 篇相关文章
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
一种用于管理 AI 变革步伐的演进式架构模式
Cloudflare推出基于QuePaxa共识算法的Meerkat服务,可无领导者写入并保持强一致性,提高网络可用性。它预计将是QuePaxa全球首次生产部署,但存在局限性,如大量往返通信。
openJiuwen协同昇腾打造智能体「算力亲和」技术,首token时延砍半,推理存储占用下降25%
传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。
谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束
消费级3DGS应用走向普通用户,但需精确位姿约束,过去靠LiDAR,成本高。如视Argus入选ECCV 2026,能从图像预测位姿等,为3DGS提供精准约束,推动其走向低成本采集时代。
Anthropic深夜连放两弹:Sonnet 5、全新AI科研App重磅上线
Anthropic 深夜发布两个重磅更新:Claude Sonnet 5和面向科研人员的AI工作台Claude Science。Sonnet 5性能接近Opus 4.8,提升Agent能力且价格低;Claude Science整合科研工具,支持复现产出、自动管理算力、多学科查询。
年薪百万,在旧金山开始租不起房了
旧金山科技情侣合计年薪超36万美金,花三月看30套房,租不到月租5000以下一居室。OpenAI和Anthropic拟IPO,AI造富改写城市生存门槛,高薪者也感窘迫。
机器人搬冰箱成了!洗碗之后又一痛点,网友:解放我的髋关节
波士顿动力最新人形机器人Atlas能搬动几十公斤重冰箱。它定位为干重活,动作模拟人类搬重物,训练靠强化学习,经参考轨迹、奖励函数、仿真训练、真机测试迭代。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文
由多校及研究团队联合提出 TACO,这是无需训练、即插即用的终端智能体自进化观测压缩框架。它能让智能体学习压缩规则,过滤低价值输出,保留关键线索,实验显示其提升了任务成功率和 token 效率。