「深度学习模型训练」共找到 8744 篇相关文章
Grok 4意外提前曝光,xAI巨额融资700亿,马斯克宣布“重写人类知识库”
xAI的Grok 4提前泄露,团队跳过Grok 3.5直接推出。它被定位为旗舰模型,有强大性能。马斯克欲用其重写人类知识库,但引发争议。xAI融资100亿,建超算中心面临电力问题。
用视频存储文本的黑科技!
memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。
支付宝出手了,全民级的AI健康管家来了。
作者参加蚂蚁AI医疗产品发布会,介绍了全新AI产品AQ。它是专门的AI健康助手,免费用,能精准定位病因,还可预约挂号,与医保打通,有健康档案等功能,打破医疗信息差,未来可期。
我在哪?要去哪?要怎么去?字节跳动提出Astra双模型架构助力机器人自由导航
当今机器人导航系统在复杂室内环境面临挑战,字节跳动研发创新双模型架构Astra,含Astra - Global与Astra - Local子模型。经实验验证其性能佳,未来有广阔应用前景,但也存在需改进之处。
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
为AI打造的知识图谱服务器MemoryMesh
MemoryMesh是专为AI模型设计的知识图谱服务器,适用于多种结构化数据场景。它有动态模式驱动工具等特性,可自动生成管理工具,还配备记忆查看器,提供安装指南和提示词建议。
华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」
文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。
统一20+多智能体方法,MASLab震撼发布
由十机构联合推出的 MASLab,带来大模型多智能体系统代码库,统一 20+主流 MAS 方法。有方法全、评估准、结构清晰特性,经大量实验刻画性能图谱,还提出新方法,且发起开源社区。
从browser-use 出发,品 Agent 实现
本文作者以学习总结视角,从browser - use出发解析Agent实现。介绍LLM不同阶段,阐述Agent记忆、规划、工具等要素,通过对话演示和源码分析展示运行机制,还探讨MCP集成和Coze space应用模式。
Lex Fridman 对谈谷歌 CEO:追上进度后,谷歌接下来打算做什么?
Lex Fridman 采访谷歌 CEO Sundar Pichai,探讨谷歌在 AI 竞赛中的逆袭、搜索和广告的 AI 模式转变、模型发展、AI 编程提效、AR 前景、自动驾驶挑战等,还谈及 AGI 及 AI 对人类的影响。