点监督」共找到 930 篇相关文章

算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
开源动态8

PDF解剖大师来了!LandingAI开源神器,这个Python库让百页文档秒变结构化数据!

复杂文档处理是数据分析痛,传统方法常因布局复杂失准。LandingAI团队在GitHub开源Python库Agentic - Doc,可从复杂文档提取结构化数据,支持多格式,新增多项功能,提升处理效率和准确性。

开源星探
算法论文8

Agent也能蒸馏了!性能超好

大模型运行成本高,普通用户用不起。传统小模型模仿大模型解题步骤易出错。论文提出Agent蒸馏,让小模型学会用检索和代码工具,还加首思前缀与自我纠错“外挂”,使小模型性能直逼大模型。

深度学习自然语言处理
开源动态7

OpenAI没做到,DeepSeek搞定了!开源引爆推理革命

文章围绕大语言模型推理能力展开,介绍了推理模型概念,回顾RLHF训练流程,对比OpenAI的PPO和DeepSeek的GRPO,还阐述了GRPO开源升级版DAPO的关键技术及训练中模型的新能力。

新智元
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特、训练方法、性能表现及局限性等。

新智元
算法论文8

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。

InfoQ
新闻资讯7

两种小金属卡了AI脖子,中国供应链占主导

在AI数据中心扩产潮中,IEEE出铒和钇两个此前少被关注的小金属,它们分别用于数据中心长距离光通信网络和供电燃气轮机。我国占这两种小金属近100%产量,且分离加工能力强。

量子位
产品应用7

豆包工作体验:Agent 正在成为工作的新入口

豆包发布“豆包工作”,定位为独立办公 Agent 工作台。体验良好,能开项目、连办公应用。文章指出用户习惯迁移,Agent 成工作入口,还探讨了办公 Agent 的竞争、权限问题、组织提效及人员角色转变等。

宝玉AI
产品应用8

鸿蒙元服务的“体验密码” | 从京东到深圳万象城,看技术底层如何让服务直达用户

AI时代,系统能感知用户场景与需求,主动推送服务。鸿蒙元服务解决用户体验痛,其技术底座帮开发者“减负”。如京东复用代码,深圳万象城优化停车服务,还为中小商户提供零代码开发方案。

InfoQ
产品应用8

1w颗星!本地化视频翻译配音工具!

KrillinAI是多功能音视频本地化与增强方案,面向人类用户和AI Agent。它功能全,覆盖视频处理完整链路;特多,支持CLI调用等;还兼容多种语音识别、大语言模型和TTS服务,可Docker部署。

GitHubStore