「两阶段训练」共找到 3112 篇相关文章
欢迎 GPT OSS —— 来自 OpenAI 的全新开放模型家族!
OpenAI推出GPT OSS开放模型家族,含117B参数的gpt‑oss‑120b和21B参数的gpt‑oss‑20b。采用Apache 2.0许可证,资源占用低、推理快,适多场景,已接入Hugging Face服务,还介绍了推理、部署等内容。
ScreenCoder:视觉-代码对齐新范式,为多模态程序合成开辟道路
前端开发中UI转代码耗时易错,现有工具存在不足。ScreenCoder提出模块化多智能体框架,通过三阶段分工协作实现代码生成,还构建数据引擎推动VLMs进化,实验表现出色,为多模态程序合成开辟道路。
AI百人榜刷屏,小扎照单全收?辛顿Ilya师徒霸榜,第二名竟是本科生
Top 100人工智能名单出炉,Ilya登顶,Hinton家族两人入选,图灵排名第六。78人有博士学位,排名第2的是本科生。清华等国内大学校友多人入选,该名单疑似启发自扎克伯格的机密人才名单。
刷新无监督异常检测上限!首提「匹配代价滤波for异常检测」范式 | ICML'25
新智元报道,东北大学等团队在ICML 2025提出CostFilter-AD,将「匹配代价体滤波」引入无监督异常检测,构建异常代价体并滤波,无需缺陷样本训练,可作插件提升现有系统,精准检测微小缺陷。
万字对谈 Physical Intelligence(π):具身智能的卡点和下一步突破,到底在哪?
本文是对Physical Intelligence联创兼CEO和核心研究科学家的访谈。他们探讨具身智能现状,指出当前瓶颈是智能软件,还谈到VLM性能、数据收集、模型训练等问题,认为通用机器人基础模型被低估。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent
近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。
借助CoT监管AI?OpenAI、谷歌、Anthropic等罕见联合发文:AI系统安全的新机遇!
OpenAI等支持新研究论文,其指出高级AI不透明性有潜在风险,而‘推理模型’用自然语言推理带来可解释窗口,CoT监控可检测不当行为、发现早期信号等,但也存在使监控性下降的因素。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情
Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。