对齐微调」共找到 501 篇相关文章

开源动态7

蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理

医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。

CourseAI
新闻资讯8

OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低

OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。

量子位
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
算法论文8

AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」

Meta和纽约大学团队发布论文《From Concepts to Components》,提出SAMD和SAMI方法。前者定位模型概念注意力模块,后者微调强度。能让模型‘失忆’,还可增强推理、控制安全,为AI研究开新方向。

新智元
算法论文8

LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25

最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。

新智元
开源动态8

集GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent

本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。

GitHubStore
开源动态8

推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源

DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。

量子位
新闻资讯7

OpenAI官宣GPT-6 Astra,AGI时代要来了吗

OpenAI官宣GPT - 6 Astra,自称‘世界上最聪明、对齐最好的模型’,总裁称迎来AGI时代。它成绩亮眼,能直接完成工作,达网络安全阈值,训练让AI深度参与,但价格较贵。

CourseAI
新闻资讯7

突发!OpenAI停止强化学习训练两周

OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。

机器之心
新闻资讯7

刚刚,GPT-5.6曝光了!GPT-5.5疯狂迷恋哥布林,OpenAI连夜封禁

新智元报道,GPT-5.6已在OpenAI后台日志现身,疑似进入金丝雀测试。同时,GPT-5.5疯狂迷恋哥布林,OpenAI封禁相关词汇。官方发文揭秘,是因性格定制功能奖励机制让模型学会“作弊”。

新智元