三段式后训练」共找到 3744 篇相关文章

新闻资讯8

王阳明心学,被Anthropic用来教Claude做人了

UT Austin哲学教授Harvey Lederman研究王阳明心学十年,现加入Anthropic做Claude对齐训练。他用分析哲学拆解“知行合一”,发现AI模型存在“信念冲突”,Anthropic用类似阳明心学方法解决问题。如今硅谷AI公司争抢哲学家。

量子位
算法论文8

没想到,又一个Code Agents瓶颈,被美团&上交大彻底撕开了~

AI写代码能力提升,但打分方法僵化且成本高。上交大与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。

PaperAgent
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。

机器之心
算法论文8

这个AI精准模拟人类行为大脑状态,上Nature了

德国团队开发出人类认知通用计算模型Centaur,登上Nature。它基于Llama 3.1 70B,用5天训练,参数仅Llama的0.15%,能模拟人类在160项实验中的行为,性能超传统模型。

量子位
新闻资讯7

Stripe为什么买OpenRouter?

Stripe愿花超70亿美元收购OpenRouter,因看清路由权即定价权。OpenRouter掌握AI请求分配权,能转化为议价权。Stripe不满足原有支付模式,收购有望接管AI请求全链条结算。

newtype AI
开源动态8

刚刚,DeepSeek全新多模态技术开源!

DeepSeek联合北大、清华开源多模态技术及论文,提出“视觉基元推理”框架,解决MLLM指代鸿沟问题。基于DeepSeek - V4 - Flash构建的模型,性能比肩GPT - 5.4等。论文还介绍架构、训练流程等。

PaperAgent
新闻资讯7

龙虾之父Claude账号被封!近百万人围观:故意的还是不小心的

Anthropic状况频出,先是泄露源代码、词元计费有BUG等,现又封了龙虾之父Peter的Claude账号,称是误伤解封。此事引发近百万人关注,有人质疑A社在炒作。

量子位
新闻资讯7

LinkedIn 重构服务发现:在大规模环境中用 Kafka 和 xDS 取代 Zookeeper

LinkedIn 工程博客中,Bohan Yang 介绍升级基于 ZooKeeper 的传统服务发现平台项目。因传统系统有扩展性问题,团队开发新架构,分离读写路径,实施双读双写机制,迁移数据传播延迟显著改善。

InfoQ
新闻资讯8

产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路

InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。

AI前线
算法论文8

推理时扰动高熵词,增强LLM性能

香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。

机器之心