「领域构建」共找到 3456 篇相关文章
首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust
MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。
Cursor也挖人了:Claude Code开发主管和产品经理被一锅端
编程神器Cursor母公司Anysphere挖到合作伙伴Anthropic两名前核心高管,原Claude Code开发负责人和产品经理将分别任Cursor首席架构师和产品负责人。这或使两家合作关系微妙,AI编程领域竞争激烈。
作业帮基础观测能力之一监控体系实践
本文介绍作业帮监控体系实践。其监控体系随云原生成长,支持全集群监控。构建时选 Prometheus 采集、VictoriaMetrics 存储,还从多维度采集指标,用自研代理降成本、治理指标,让系统更贴合研发。
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!
复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。
Claude 或将推出 App Builder 功能,打造新的 App Store
Anthropic或为Claude推出App Builder功能,用户能从零构建全栈应用。此前Anthropic已从工具向平台转型,而OpenAI的GPT Store尝试失败,App Builder若成功,Claude将成新应用分发入口。
ChatGPT缔造者联手DeepMind大神,用AI攻坚高温超导,半个硅谷抢着投
OpenAI前研究副总裁Liam Fedus与DeepMind材料科学领军者Ekin Cubuk共创Periodic Labs,以3亿美元种子融资走出隐身模式。他们要打造「AI科学家」,构建自主实验室,攻坚高温超导等难题,获众多资本青睐。
NeurIPS 2025 Spotlight | GeoSVR:稀疏体素的新潜力——超越3DGS系列的高精度三维表面重建
计算机视觉中表面重建难题待解,现有方法有瓶颈。北航等团队提出 GeoSVR 框架,围绕几何约束与表面正则化设计,在多数据集超现有方法,兼顾精度、完整性与效率,为多领域提供支持。
你的AI助手更万能了!天禧合作字节扣子,解锁无限新功能
天禧个人超级智能体和字节跳动扣子官宣生态合作。天禧是联想新一代AI助手平台,扣子开发成本低、功能完善。合作解决开发者痛点,让用户体验多元AI能力,彰显联想构建AI生态决心。
阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁
阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。