「统一思维链」共找到 965 篇相关文章
3200+ Cursor 用户被恶意“劫持”!贪图“便宜 API”却惨遭收割, AI 开发者们要小心了
近日,网络安全研究人员标记出三个恶意 npm 软件包,攻击 Cursor 编辑器 macOS 版用户,超 3200 次下载。这些包伪装提供‘最便宜 API’窃取凭据、替换代码,还凸显供应链威胁。
长三角破局:技术跑进无人区,产业链如何跟上?
中国制造业正从「跟随者」变为「开拓者」,但产业化体系滞后。长三角推出「一条龙」计划,解决供应链、验证和迭代难题,初步成果显现,正开启产业化范式革命。
小扎秘密研发CEO Agent!开源「人生托管系统」爆火
《华尔街日报》披露,扎克伯格正开发“CEO Agent”,绕过汇报链获取信息。同时,一AI博士生因生活管理难,开源含8个Agent的“人生托管系统”,引发讨论并指出隐患。
【开源】Multica:让 AI Agent 成为真正的团队成员
Multica 是开源的 Managed Agents 平台,能统一分配任务、跟踪进度、积累经验。它把 AI Agent 当团队成员管理,有5个关键能力,兼容8种主流 Agent,支持自部署,5分钟可上手,但生态尚处早期。
电商上演「魔法对轰」:卖家用AI假图骗下单,买家拿AI烂水果骗退款
电商领域,卖家用AI假图骗下单,买家拿AI假图骗退款,双方上演“魔法对轰”。单一证据易伪造,平台探索技术和策略组合,建立统一数字内容标准或成破局关键。
自动化评测的九九归一——评测agent
本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。
The Batch: 896 | 教会模型说出真相
大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。
普林斯顿发现RLHF显著加剧了LLM胡扯!
普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。
阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!
在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。
LLM长文本内卷,谁是真英雄?告别跑分玄学,我们需要一把“公道秤”
OpenNLG Group做了统一长上下文评估框架LOOM - Scope,兼容主流benchmark、model和长上下文加速方法。该框架围绕BENCHMARK、DEPLOYMENT和EVALUATOR三大核心模块,还提出LOOM - Bench应对评估成本制约。