大模型接入」共找到 9263 篇相关文章

算法论文8

前OpenAI科学家&GPT之父:预训练精准数据过滤,极低成本削弱模型危险能力数千倍

Claude价值观塑造者Neil Rathi和GPT之父Alec Radford发论文,提出预训练时精准“删掉”危险知识碎片,以极低计算成本将模型特定危险能力削弱数千倍,且不损通用智能。

AIGC开放社区
算法论文8

模型能“原地”改参数了!字节Seed&北新论文:测试时推理无需加层重训练

字节Seed和北研究团队提出In - Place TTT方案,让模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。

量子位
算法论文8

ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解模型水印效力与文本质量的两难困境

随着模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。

深度学习自然语言处理
新闻资讯7

模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
算法论文8

从答题到做实验:SciAgentGym让模型进入科学工作流

复旦学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。

机器之心
算法论文8

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港×MIT联手重新定义扩散模型训练速度上限

NVIDIA、港、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。

机器之心
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两挑战,为AI代理发展指明方向。

深度学习自然语言处理
产品应用7

Claude Code 实战横评:GLM4.5 vs DeepSeek 3.1(附Windows MCP配置,免费模型接入

文章对Claude Code里GLM4.5和DeepSeek 3.1进行实战横评,涵盖数据库、网站、游戏等测试案例。还介绍Claude Code在Windows下配置MCP经验,以及接入GLM、Deepseek等模型的方法和免费平台。

AI进修生
算法论文8

模型「持续注入新知识」,北航CASE框架:编辑千次不失忆,额外参数不到1MB丨WWW'26

北航团队提出CASE框架解决语言模型持续吸收新知识难题。该框架给编辑“算分”、调“关键神经元”,破解核心痛点。实验显示,1000次编辑后准确率提升近10%,额外参数不到1MB。

量子位
开源动态8

GitHub 23.6k star 的 BMAD Method:如何把模型系统提示词,变成一支“可复制的 AI 开发团队”?

BMAD Method是开源的AI驱动敏捷开发方法论与工具集,基于BMAD Core框架,有19个专业AI角色和50+条工作流,获23.6k颗GitHub Star。它解决了模型使用痛点,将AI开发工程化,可在多工具复用。

小华同学ai