「大模型训练」共找到 9570 篇相关文章
一篇综述:知识图谱的3种类型,6大推理任务
知识图谱(KGs)在认知智能系统中作用关键,知识图谱推理(KGR)能基于现有事实推断新知识。文章综述了3种知识图谱类型、6大推理任务,介绍推理方法、应用,还指出KGR面临的挑战与机遇。
FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度
深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。
好你个智谱,模型价格搞双标:中国一套外国一套
网友发现智谱Max计划国内外价格差异大,中国469元(约68美元),西方160美元,引发热议。Hugging Face产品负责人力挺GLM - 5.1,而Claude被曝性能下滑、成本增加。
大厂离职后,白天是保安,夜里是 AI 创造者
本文讲述杨晨从大厂运营离职后成为保安,白天观察人间百态,夜里用AI搞创作。他用AI为家人、朋友做工具,还帮公司做定制化工作流,赚了点小钱。他也想记录普通人故事,认为大家可借AI改变生活。
刚刚!Meta把大模型塞进脑机接口,隔空读脑直逼开颅植入水平,代码全开源
Meta推出Brain2Qwerty v2,号称性能最强端到端方案,能基于非侵入式脑部记录实现实时句子级解码,准确率逼近开颅手术水平。还开源代码,公开数据集,旨在帮脑损伤患者交流。
AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android
Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。
拥抱大模型:深入剖析ReAct的核心原理、技术架构及其对AI领域的深远影响
文章深入剖析ReAct,它是普林斯顿大学和谷歌团队提出的智能体架构范式,将推理与行动协同,构建TAO闭环。介绍其原理、架构,指出解决传统AI难题,也存在局限,未来可与强化学习等融合。
重磅!Thinking Machines开山之作:大模型输出随机的根本原因被揪出,并开源终结方案
由OpenAI前CTO创办的Thinking Machines宣布上线技术研究博客,开篇文章揪出LLM输出随机的根本原因是负载及批次大小的非确定性变化,并给出系统性解法,还开源方案。
刚刚,OpenAI前CTO Mira Murati公司Thinking Machines Lab发文,揭开了大模型不确定性的真相
OpenAI前CTO Mira Murati创立的Thinking Machines Lab推出研究博客Connectionism,首篇文章聚焦LLM推理的非确定性问题。研究发现真正原因是批次不变性缺失,提出实现批次不变内核的方案,实验效果显著。
AI低质代码泛滥、API经济盛行,老牌科技厂商 F5 如何应对大模型应用“后遗症”?
F5亚太区CTO Mohan Veloo指出AI编程工具带来安全、低质代码、‘黑盒子’等问题。F5调查显示企业业务AI驱动下,安全成挑战。F5推出ADSP平台应对,还发布AI Gateway、AI助手等产品。