训练数据生成」共找到 5596 篇相关文章

开源动态8

MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
产品应用8

3万字长文带你WorkBuddy 从入门到精通

这是 WorkBuddy 的「从入门到精通」指南。介绍了它在 Windows 和 Mac 上的安装、登录、更新方法,功能涵盖新建任务、助理页面、项目页面等。还讲了技能、连接器、专家中心的使用,以及自动化、资料库、灵感等功能,还有实践案例、使用技巧和常见问题解答。

腾讯技术工程
开源动态8

华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。

机器之心
算法论文8

扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%

论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。

深度学习自然语言处理
产品应用8

拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?

多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。

AI科技评论
新闻资讯7

警惕全球“最大”芯片IPO的暴雷风险

Cerebras 5月14日上市成2026年迄今全球最大IPO。其核心产品WSE工程有突破,但良率计算方式与传统不同。训练未成功,推理找到新机会。与OpenAI超200亿美元合同背后是股权换订单,财务数据也有隐忧,上市后存诸多疑问。

芯师爷
开源动态8

腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒

腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。

量子位
新闻资讯8

靠AI把股价干涨735%,这家公司开始成批裁掉可替代岗,全员招聘须CEO点头

AppLovin联合创始人兼CEO Adam Foroughi分享公司发展历程。他曾借钱60亿美元回购股票获600亿美元回报,押注AI使股价涨735%。公司经历人员结构调整,清退老高管和可被LLM自动化岗位,招聘须他亲批,超80%代码由大语言模型生成

AI前线
产品应用7

【CUDA 博客】TMA简介 & 让矩阵转置在Hopper GPUs上变得更快

文章介绍Hopper GPU新特性TMA,它能高效传输多维数组数据。文中展示用TMA对2D数组操作,如创建张量映射、编写kernel等。还讲了避免共享内存bank冲突的交织方法,最后介绍在Hopper GPU上实现高效矩阵转置的多种方式及性能。

GiantPandaLLM