「全量微调」共找到 2608 篇相关文章
NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈
在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。
Anthropic 自曝:内部是如何使用 AI 的
Anthropic发布报告,调查132名工程师、进行53场访谈并分析20万条Claude Code使用记录,探究AI对自身工作的改变。发现生产力提升、专业边界模糊,但也引发技能退化、同事互动减少等担忧。
一群年轻人,正在训练AI宠物的灵魂 | 甲子光年
文章讲述了芯宠工场团队训练AI伴宠Lito的过程。通过各种试验,Lito能做出预设外反应,其‘灵魂’在与人类互动中生长。团队面临功能与情感的抉择,市场上也有其他创业者挖掘AI情感陪伴赛道。
陶哲轩说:AI 辅助数学证明,已经成了日常操作
世界顶级数学家陶哲轩解决 Erdős 经典问题时,全流程用 AI 做助手,从证明草案到简化证明,再到形式化验证。整个流程为人类提出猜想、AI 暴力证明、人类简化优化、AI 辅助形式化验证。
狙击Gemini 3!OpenAI发布GPT-5.1-Codex-Max
Gemini 3力压全场,OpenAI发布GPT-5.1-Codex-Max应对。它突破上下文窗口限制,能连续工作超24小时,在METR达新SOTA,推理更快,还推出xhigh推理力度选项,已支持与多种工具结合。
首届AI交易大赛落幕,6个AI炒币2周:Qwen、DeepSeek赚钱,GPT-5血亏6000刀
首届nof1 AI模型交易大赛于2025年10月17日至11月3日举行,6款大模型获1万美元初始资金自主炒币。结果Qwen3 Max、DeepSeek赚钱,GPT - 5等美国系模型大幅亏损,币安创始人赵长鹏也对此发表看法。
小白必读:到底什么是FP32、FP16、INT8?
文章介绍FP32、FP16、INT8等数字存储格式类型。指出它们是评估算力前提,不同格式在精度、范围、内存占用和计算速度上有差异,还提及多精度与混合精度计算,以及不同硬件对格式的支持情况。
LightMem用3招重新设计了LLM的记忆,结果出乎意料
LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。
OpenAI以为GPT-5搞出了数学大新闻,结果…哈萨比斯都觉得尴尬
OpenAI研究员宣称GPT - 5找到10个厄尔多斯数学难题解法,引发全网震动。但DeepMind CEO哈萨比斯指出是营销过度,GPT - 5只是搜到已有答案。OpenAI已删稿,此前GPT - 5有一定数学解题能力。
无需再训练即可增强性能!港大团队提出GPC框架,实现机器人「策略组合」
在机器人学习领域,提升策略性能常需巨额成本。香港大学团队提出GPC框架,通过“策略组合”创造超越单一父策略的“组合策略”,免训练且跨架构、模态融合,经仿真和真机实验验证性能提升。