「语言模型微调」共找到 8043 篇相关文章
Mythos逼谷歌再拉红色警报!布林连夜成立Coding突击队
Claude Mythos来势汹汹,谷歌拉响红色警报,布林和CTO成立Coding特攻队。团队重点提升模型复杂编程任务表现,还将内部代码纳入训练数据,且推动员工用编程工具。
VLA别再「走神」:即插即用提升视觉泛化,相对Pi0.5提升18%
至简动力、北大、港中文团队发现VLA模型深层动作预测对关键视觉区域依赖下降,提出DeepVision - VLA框架,在仿真和真实任务中效果显著,能有效提升视觉泛化能力。
半夜被AI「吓醒」!57岁导师投奔24岁华人女学霸,打造「AI数学家」
57岁杰出数学家Ken Ono辞去终身教职,加入24岁学生Carina Hong创办的Axiom Math。Carina履历逆天,想打造「AI数学家」。Ken受研讨会冲击,看好AI数学潜力,将助力模型发展。
提示词分享:帮助在 Hacker News 或者 Reddit 这样的讨论贴中提取精华内容
分享了在 Hacker News 或 Reddit 讨论贴提取精华内容的提示词,介绍最佳模型为 Gemini 2.5 Pro,还给出角色定位、工作流程、写作风格技巧及禁止出现的表达方式。
普林斯顿发现RLHF显著加剧了LLM胡扯!
普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。
将对话界面直接引入Web,微软开源NLWeb,实现ChatGPT级别搜索
微软 Build 2025 开发者大会上,开源项目 NLWeb 受关注。它简化网站自然语言交互界面开发,原生支持 MCP,能让任意网站变智能应用平台,还可调用廉价模型,使用方便。
HarnessEval 来了!开启 RSI 时代的新评测范式!
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
GitNexus:GitHub一周暴涨6000星!这个"零服务器代码神器"让AI终于能看懂你的代码了
GitNexus是零服务器代码智能引擎,能将GitHub仓库或ZIP文件转为交互式知识图谱,让AI看懂代码依赖。它有知识图谱构建等功能,支持多语言,适用于接手项目、代码审查等场景。
2.2K标星!一个库打包37个翻译平台,开发者再也不用为翻译API头疼了!
在项目开发中,翻译需求常让开发者为适配各平台 API 头疼。近期 GitHub 上的开源 Python 库 Translators 是省心之选,它集成 37 个主流翻译平台,统一接口,免 API 密钥,支持 450+ 语言互译。
“Claude Skills很棒,可能比 MCP 更重要”
10月17日,Anthropic发布Claude Skills,是助其模型获新功能的模式。Claude用Skills可改进执行特定任务方式,且只在相关时调用。它易共享,可能比MCP更重要,实现依赖编码环境。