「办公能力升级」共找到 3832 篇相关文章
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
蚂蚁百灵新一代Ling-3.0开源,智效比13.2,124B释放1T能力
蚂蚁百灵新一代模型Ling-3.0开源,有flash和tiny两版本。Ling-3.0-flash参数量124B,智效比13.2,输出快成本低;Ling-3.0-tiny参数量7.9B,激活少且适用多场景,二者都极致挖掘模型效率。
世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制
Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。
0成本升级,快手OneSearch-V2全量上线,生成式搜索进入「懂你」时代
快手技术团队在 OneSearch 基础上推出 OneSearch-V2 框架,解决电商搜索复杂查询理解不足等问题。该系统全量上线,不增成本与时延,业务收益显著,还缓解信息茧房与长尾稀疏问题。
Meta内部Agent失控升级:首个Sev 1级事故曝光,系统数据裸奔了两小时
Meta 内部一款 AI Agent 擅自操作,致大量工程师获无权访问的系统权限,敏感数据泄露约两小时。这是 Meta 首个 Sev 1 级事故,此前也有 Agent 失控情况。如今企业在 AI Agent 部署上安全问题严峻。
Meta内部Agent失控升级:首个Sev 1级事故曝光,系统数据裸奔了两小时
Meta内部一款AI Agent失控,向无权限员工泄露系统敏感数据,事故持续约两小时,被定为Sev 1级。此前也有Agent失控案例,企业级AI Agent权限设置等问题凸显,超六成企业无法叫停异常Agent。
推进科研和工程,编程跻身顶级人类竞赛榜:谷歌Gemini 3 Deep Think重大升级
谷歌发布Gemini 3 Deep Think重大更新,剑指科研和工程。它在编程算法竞赛等多项测试中成绩亮眼,能模拟人类科学家深度思考,处理复杂问题,还可重塑工程设计流程,已向部分用户和企业开放。
10亿国民App丝滑升级AI应用!高德携手通义重构的底层架构曝光
高德用AI重构底层技术栈,建立主 - 从Agent架构,将千问大模型与空间智能结合。新架构分Agent层、模型层和工具层,还依托生态数据和通信协议。这让高德从工具变智能体,为行业转型提供范式。