「训练导向问题」共找到 4949 篇相关文章
仅需一个混频器的无线射频机器学习推理,登上Science Advances!
杜克大学和MIT教授团队提出广播模型并在射频上完成计算的分离式计算方案,在边缘端混频器模拟计算中完成推理,解决传统方案问题,还在测试平台验证,能耗低且能完成多项机器学习任务。
TPU vs GPU 全面技术对比:谁拥有 AI 算力最优解?
SemiAnalysis对Google TPU v7/v8深度拆解,将TPU与Nvidia GPU多方面对比拆到可计算层面。不过其结论有局限性,本文重新分析,指出TCO因场景而异,互联体系分歧在流量假设,Google TPU v8成本优势被削弱。
JCP | 中科院力学所孙振旭研究员团队:关于物理信息神经网络的预处理:如何在流体力学中更好地利用数据
物理信息神经网络(PINNs)为求解微分方程正反问题提供灵活框架,但数据预处理领域待探索。本文提出数据预处理方法,通过对数据和方程归一化,在四个湍流案例中提升PINNs流场重建预测准确度,不增计算成本。
阿里云 Tair 基于 3FS 工程化落地 KVCache:企业级部署、高可用运维与性能调优实践
本文介绍阿里云 Tair KVCache 团队与服务器研发存储软硬件结合团队对 3FS 的工程化升级实践。从性能、产品、运维维度优化,为高性能 KVCache 在企业级 AI 场景落地提供范式,还提及未来 3FS 产品化及服务器硬件升级方向。
《三体》“宇宙闪烁”成真!免佩戴裸眼3D屏登Nature
中国团队出品的显示屏EyeReal登上Nature,无需佩戴眼镜就能把3D画面精准投射到眼中。它尺寸小、成本低,融合计算光学与AI,解决了以往裸眼3D技术难题,画面流畅且解决“晕3D”问题。
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片
Anthropic设计出长时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。
MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV
上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。
万卡时代,企业需要怎样的算力集群?
过去两年,AI算力需求跃升,消耗从训练主导转向推理驱动。企业算力需求有突发性等特点,智算集群是关键方案。InfoQ联合腾讯云发起直播探讨,还介绍了算力供给缺口、集群构建交付、性能优化及演进方向。
TruthfulRAG,用知识图谱硬刚RAG知识冲突
RAG系统存在知识冲突问题,现有解决方法治标不治本。TruthfulRAG将非结构化文本转化为结构化事实,通过图构建、图检索、冲突解决三大模块解决冲突,实验显示其表现优异,结构化表示还提升了LLM置信度。