「大数据」共找到 6656 篇相关文章
Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集
Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。
Cursor 内置三大文档工具,为AI 编程注入精准上下文
大模型编程易因知识陈旧致代码出错,为其提供实时上下文是关键。Cursor 有 @Docs、@Web、MCP 三大文档工具,能处理不同文档,还可协助创建和更新文档,弥合模型知识与项目需求的鸿沟。
北大联合Llama-Factory推出DataFlex:工业级数据动态训练系统
北大张文涛教授、鄂维南院士团队联合多机构推出大模型数据中心动态训练框架DataFlex。它是统一训练基础设施,纳入三类核心能力,解决底层系统问题,在效率和效果上有提升,受社区认可。
Manus数十亿美元卖身Meta,智谱夺得全球大模型第一股
2025年末中国AI领域有两大喜事,通用AI Agent公司Manus被Meta数十亿美元收购,其发展迅速成果显著;智谱启动招股,即将成为全球大模型第一股,虽研发投入高,但营收增长快,获资本青睐。
即将截止征集 | 全国首部AI数据标注合规标准,欢迎加入!
由中国电子商会归口、智合标准中心组织、中移互联网牵头起草的全国首部AI数据标注合规标准《面向人工智能的数据标注合规指南》,历时7个月,经多轮研讨,即将修订报批,仍有参编机会。
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播邀请华为、蚂蚁集团等专家探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代冲突处理、推理部署成本优化、开源项目挑战及 GPU 虚拟化趋势等内容。
大模型化身苏格拉底:通过主动提问挖掘人机协作的深度
微软与南加州大学联合团队研究揭示激发大模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义大模型角色。
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播,邀请华为昇腾专家 ZOMI 酱、蚂蚁集团马介悦和 SGLang 尹良升探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代策略、推理部署优化、开源项目挑战等内容。
五角大楼计划将绝密数据喂给AI,训练军事特供版模型
《麻省理工学院技术评论》称,五角大楼正讨论为生成式人工智能公司建安全环境,用机密数据训练军事特定版本模型。美国军方重构战略,推动先锋项目,还筹备用绝密数据训练模型,引发安全担忧。
OpenAI 最新报告:让团队变得 AI Native 的五大原则
OpenAI 发布白皮书《Staying ahead in the age of AI》,基于与国际大公司合作经验,提炼出让团队变得 AI Native 的五大原则,即对齐、激活、放大、加速、治理,还给出各原则策略及反思问题。