预训练策略」共找到 2842 篇相关文章

算法论文8

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

近日苹果发布重磅论文,提出 RL4HS 方法,用强化学习训练模型,能准确标出答案中幻觉部分,还使用片段级奖励和类别感知的 GRPO,在片段级幻觉检测任务上超 GPT - 5 和 o3。

机器之心
推荐文章7

一个半月高强度 Claude Code :Vibe coding 是一种全新的思维模式

开发者王巍记录使用Claude Code感受与经验。提到Vibe coding是新思维模式,还分享从传统Editor AI转换的体验,以及CC的边界、使用模式、迭代方式等,也谈到其限制与应对策略

Founder Park
算法论文8

PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)

当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。

AINLPer
新闻资讯8

Claude Code把自己的提示词删掉80%,我照着砍了自己的60%

Anthropic将Claude Code系统提示词删减超80%,编码评测表现无明显下降。文章阐述删减背后判断,给出六条变化策略、四类文件写法及两条方法论,还介绍实施步骤,作者按此精简提示词约60%。

花叔
新闻资讯8

人形机器人交付元年,行业从卷模型转向拼数据

2026年是具身智能交付元年,行业从卷模型转向拼数据。全球权威机构重新定义“人形机器人数据”地位,真机数据是模型落地关键。乐聚等企业积极布局,通过训练场模式获取数据,解决行业痛点。

DeepTech深科技
新闻资讯7

笑死!xAI员工竟用Claude写代码?这回Anthropic反手拔了马斯克的网线

2026年1月8日消息,xAI联合创始人通知员工,Cursor中的Claude模型无法响应,是Anthropic针对对手的新政策。此前Anthropic已多次调整策略,封杀竞争对手,其目的包括保护数据资产等。xAI或加速自研,行业或开启军备竞赛。

新智元
算法论文8

极简主义的胜利:清华团队用最简单的强化学习配方刷新1.5B模型纪录

清华、伊利诺伊大学和上海AI实验室团队提出JustRL架构,仅用单阶段训练和固定超参数,在1.5B模型上刷新性能纪录,计算量仅为复杂方法50%,挑战了复杂技术堆叠现状。

AIGC开放社区
新闻资讯7

OpenAI算力账单曝光:70亿美元支出,大部分钱花在了“看不见的实验”

据Epoch AI统计,去年OpenAI计算资源支出70亿美元,多以租微软云算力支付。其中50亿研发算力,大多用于幕后研究和实验,非爆款模型的最终训练,也解释了其2024年亏损原因。

量子位
新闻资讯7

刚刚!Sam Altman官宣:Plus用户GPT-5推理提至每周3000次,AI版电车难题已来

Sam Altman官宣ChatGPT Plus用户GPT - 5级推理额度提至每周3000次,还将更新UI、公布算力权衡策略。同时指出GPT - 5推出带来AI情感依恋及伦理困境,如AI成情感寄托时公司如何应对等问题。

AI寒武纪
产品应用8

超脑未来WorldDreamer V4横扫多个权威榜单,世界模型进入群体智能时代

超脑未来发布 WorldDreamer V4,它以多智能体为基本单位,具多种核心能力。采用新训练架构,引入 Masked Agent Modeling,用共享隐式世界状态带来新协同范式,还在多权威榜单领先。

机器之心