「大模型管理」共找到 9656 篇相关文章
刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型
OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。
DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈
在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。
Rust 版 OpenClaw 来了!单文件、零依赖、强沙箱、自带“故障转移”!
Rust版OpenClaw——Moltis问世。其零依赖、全沙箱、反泄露,以Rust架构带来多好处,还统一模型接口,支持本地模型离线运行,安全和存储机制出色,是面向生产的Agent框架。
开源要变天了,刚刚,OpenAI开源gpt-oss-20/120b,o4-mini水平,主打Agentic
OpenAI正式开源gpt-oss模型,Anthropic推出Claude Opus 4.1,Google DeepMind发布Genie 3。gpt-oss有20B和120B两个版本,前者可在边缘设备运行,后者综合能力强,在多方面表现出色。
超 10 万人都在看!Qwen3重塑文本嵌入与重排序技术版图
文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。
别再只卷Prompt 了,真正拉开Agent差距的是Context Engineering
本文梳理AI Agent从Prompt工程、ReAct范式到上下文工程的演进路径,系统讲解上下文工程核心原理、设计方法与落地方案,解决生产级Agent长任务质量退化痛点。
【访谈对话】造过 Codex 的人,为什么每天用 Claude Code
Calvin French - Owen 曾参与构建 Codex,如今日常用 Claude Code。他与 Garry Tan 在 YC 播客对话,探讨了编程 Agent 产品哲学差异、分发逻辑、上下文工程等,还提及 Segment 重建、未来设想及安全等问题。
昇腾MindSpeed:分布式训练加速库的创新实践与突破
在2025年QCon全球软件开发大会上,华为工程师郑加利分享昇腾MindSpeed分布式训练加速库。它在计算、通信、显存等多维度优化,提升训练效率,还介绍业界加速库及MindSpeed架构,阐述多种优化策略。
4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25
扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。
从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026
NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。