「语言处理」共找到 1989 篇相关文章
不死的程序员
文章回顾计算机技术演进中八次“程序员替代论”浪潮,从编译器诞生到如今大语言模型崛起。虽每次都预言程序员被取代,但实际是角色重塑、分层,新需求增长超人力节省,程序员价值仍在。
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播邀请华为、蚂蚁集团等专家探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代冲突处理、推理部署成本优化、开源项目挑战及 GPU 虚拟化趋势等内容。
哈工大发布动画多智能体,文本一键生成连贯动画
随着多模态模型兴起,AI生成叙事性视频成热点,但现有方法处理长视频有挑战。哈工大发布AniMaker框架,由多个智能体协作,实现文本到动画自动化转换,解决了视觉连贯和叙事一致等问题。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。
揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon
在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。
上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下
上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。
从零开始200行python代码实现LLM
文章从传统思路出发,用Python实现极简大语言模型,介绍从零基础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch基础,最后实现pytorch版Bigram模型,后续将实现完整GPT。
大模型微调知识与实践分享
文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。