「后训练方法」共找到 4825 篇相关文章
Anthropic 联创:2028 年实现 AI 自我构建的概率超过 60%
Anthropic 联合创始人 Jack Clark 发长文称,到 2028 年底,AI 实现端到端自动化研发概率超 60%。他分析多维度测试数据,指出 AI 在代码、科研、自我训练和管理等方面能力提升,也探讨了成真后的影响,但遭黄仁勋和陶哲轩质疑。
刚刚,马斯克开源Grok 2.5:中国公司才是xAI最大对手
马斯克主导xAI正式开源Grok 2.5,Grok 3将半年后开源。Grok可在HuggingFace下载,运行有条件。虽Grok 2曾有不错表现,但网友对其参数权重、开源协议等有诟病。此外,还更新APP视频生成功能,马斯克称中国公司是xAI最大对手。
Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?
Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。
为什么林俊旸会离职? | 甲子光年
3月4日凌晨,阿里Qwen团队技术负责人林俊旸宣布离职,同一天Qwen后训练负责人郁博文也正式离职。阿里刚开源Qwen 3.5小尺寸模型获马斯克点赞,此时核心团队出走引发关注。林俊旸离职或因团队分拆、管理范围缩小及“开源”与“闭源”的矛盾。
SEO是什么?SEO一般指搜索引擎优化
搜索引擎优化(SEO)是通过分析搜索引擎排名规律,优化网站内容,提高自然排名的技术。它关乎网站能否在行业内占据领先地位,获取品牌收益。但SEO方法有黑白帽之分,选择不慎可能面临搜索引擎惩罚。
苹果竞价搜索广告(ASM应用商店营销)到底是什么?
ASM广告位展示的产品在用户自然搜索结果的前10名位置再次出现,即使App的自然排名本不在Top10以内。这种推广方式能为App带来额外的曝光机会,同时提高下载转化率。
Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU
对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。
清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”
清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。
从「知题」到「知人」:UserRL让智能体学会「以人为本」
大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。