动态训练策略」共找到 3064 篇相关文章

开源动态8

首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等

清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。

机器之心
算法论文8

GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent

近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。

AI科技评论
算法论文8

借助CoT监管AI?OpenAI、谷歌、Anthropic等罕见联合发文:AI系统安全的新机遇!

OpenAI等支持新研究论文,其指出高级AI不透明性有潜在风险,而‘推理模型’用自然语言推理带来可解释窗口,CoT监控可检测不当行为、发现早期信号等,但也存在使监控性下降的因素。

PaperAgent
开源动态8

3.2K star!!高中生开发,媲美IDM,这款开源下载神器厉害了!

最近发现一款开源项目Ghost - Downloader - 3,由高中生独立开发,支持三平台,用Python编写且运行快,还融入AI技术自动调教下载策略。已有3.2K star,功能强大,安装和使用都简单。

开源先锋
新闻资讯8

对话 Ruby on Rails 之父:发自内心恨透 Copilot,手凿代码才是程序员的乐趣

传奇程序员 DHH 做客播客,深入探讨世界观。他虽用 AI 学习,但担忧 AI 编程助手致技能退化,‘恨透’它。还谈及编程经历、语言看法、架构偏好、商业哲学等,观点鲜明,引发关注。

AI科技大本营
算法论文8

揭示隐藏联系:RLHF/DPO即对比学习!

大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。

深度学习自然语言处理
算法论文8

这个推理模型:HRM ,只用2700万参数,超越了DeepSeek和Claude

Sapient Intelligence研究者受大脑机制启发提出分层推理模型HRM,它是全新循环架构,仅2700万参数、1000个训练样本,就在复杂推理任务上表现卓越,还引入近似梯度等方法,有推动通用计算变革潜力。

AINLPer
算法论文8

更多thinking≠更好结果,精准thinking可砍掉一半长度

当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。

深度学习自然语言处理
开源动态7

为AI打造的知识图谱服务器MemoryMesh

MemoryMesh是专为AI模型设计的知识图谱服务器,适用于多种结构化数据场景。它有动态模式驱动工具等特性,可自动生成管理工具,还配备记忆查看器,提供安装指南和提示词建议。

GitHubStore
开源动态8

SGLang 推理引擎的技术要点与部署实践|AICon 北京站前瞻

SGLang 是开源推理引擎,截至 2025 年 6 月,在 GitHub 获近 15K Stars,月均下载超 10 万次,被多家行业巨头采纳。InfoQ 专访其核心开发者尹良升,他分享技术、挑战等,6 月 27 - 28 日他将在 AICon 演讲。

AI前线