「模型训练师」共找到 8338 篇相关文章
Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
现在3行配置就能让GPT - 5.6 Sol封印解除,在Codex里用上1M上下文。不过有网友警告轻易别用,因超出默认窗口,模型消耗token速度会翻倍,且模型上下文利用能力会下降。此外,Codex确定会上Astra。
LLM提示三剑客:解密CoT、ReAct、DSP如何提升AI准确率?
LLM提示分思维链(CoT)、ReAct和声明式自我提示(DSP)三类。CoT鼓励模型推理,适合多步骤复杂问题;ReAct结合推理与动作,是代理基础;DSP让模型声明计划,用于模块化任务。还给出使用场景与对比。
Mythos:普通人能自由使用旗舰 AI 的时代,可能要结束了
两天前,Anthropic 发布最强模型 Claude Mythos Preview,各方位性能超 Opus 4.6 模型,却不公开发布,只面向少数合作方开放。这或预示普通人自由用旗舰 AI 的时代将结束,引发对 AI 未来商业与使用模式的思考。
CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态
CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。
Jina AI创业复盘:AI团队的Scaling Law是什么
本文是对 Jina AI 创始人肖涵的访谈,复盘六年创业历程。他两次转型,最终聚焦搜索底座模型,公司被 Elastic 收购。他分享创业得失,认为团队聚焦、高效运营是壁垒,还给出未来创业者专注、找优秀人才等建议。
电脑操作、技能、连接器、工作伙伴:豆包的牌来了
最近字节有两个豆包相关新闻,一是在训练超大模型,二是反对模型蒸馏。豆包上线大批 Agent 相关工作任务能力,覆盖办公场景,如电脑操作、技能商店等,过程流畅且可观察,还更新移动端,实现远程控制。
1/10成本、Opus 4.7级表现,Cursor甩出了性价比之王Composer 2.5
Cursor推出新模型Composer 2.5,成本仅为Claude Opus 4.7的1/10,性能几乎追平。它更智能,擅长处理长时任务,遵循复杂指令更可靠。未来一周使用额度翻倍,还宣布与SpaceXAI合作训练新模型。
Claude Code 究竟牛在哪里?(以及如何在你的 AI 智能体中复刻它的魔法!)
文章介绍Claude Code是出色的AI智能体,比Cursor等好用。它设计简单,提示词和工具弥补模型缺点。作者基于使用经验,给出打造类似智能体的要点,包括控制循环、提示词、工具和可引导性等方面。
ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE
长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。
60天融资数千万,何泳澔出任CTO!这家黑马冲刺「最后一公里」
本文报道具身智能赛道初创虚时科技,60天内累计完成数千万元融资,前地瓜机器人具身智能算法负责人何泳澔出任CTO。公司押注仿真训练解决机器人落地数据瓶颈,推出全链路闭环仿真训练系统,已获得工业场景订单。