大数据任务」共找到 7722 篇相关文章

算法论文8

ChatGPT到底学了多少「污言秽语」?清华团队首提语言模型中文语料污染治理技术

清华等团队研究发现,先进ChatGPT系列模型中文词表污染达46.6%,含色情、赌博等词元。团队定义分类中文污染词,构建识别模型,还能由词表污染估计数据污染,为语料治理提供方案。

机器之心
推荐文章8

阿里云 CIO 蒋林泉:AI 模型时代,我们如何用 RIDE 实现 RaaS 的首次落地?

阿里云 CIO 蒋林泉分享模型落地实践,指出 AI 是时代“电梯”,企业需迅速搭乘。介绍阿里云数字人多场景应用成果,提出 RIDE 方法论助企业落地,还剖析翻译与 Agent 模式要点及 E2E 落地关键。

阿里云开发者
算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态模型推理对齐难题

在多模态模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
新闻资讯8

海淀105款模型背后:看这些AI玩家如何抢占内容生产制高点

在北京海淀文化沙龙上,家探讨AI如何重塑内容生产。海淀有105款备案模型,占全国五分之一。快手可灵月入超1亿,AI音乐模型让创作众化,投资人捕捉到AIGC创业潮,新的内容生产秩序正被改写。

量子位
开源动态8

2026 AI 模型技术体系综合开源影响力榜单发布,中国开源实力领跑全球

2026年全球AI产业迈入新阶段,开源生态影响力成关键。4月17日CSDN联合多家机构发布《2026模型技术体系综合开源影响力榜单》,从四维度、53项细分指标评估,呈现开源生态地图,助力中国AI开源跨越。

AI科技大本营
开源动态8

不用额外缓存!英伟达开源模型记忆压缩方案,128K上下文提速2.7倍

英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。

量子位
产品应用7

AIGCode宿文:我就是要自训练模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育模型的最佳场景,公司自训练66B基础模型,发布锡月模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
开源动态7

20人团队提前实现DeepSeek构想,AI算力变天?直击模型算力成本痛点

国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对模型训推痛点,与DeepSeek构想契合,或成模型专用架构分水岭。

新智元
新闻资讯7

模型私有化火了:百万一台的一体机卖疯,最赚钱的一层却没人愿干

文章指出模型私有化部署虽因合规、开源模型及国产算力发展而兴起,但利润结构呈哑铃状。算力层规模但毛利低,模型层因开源难盈利,交付层最赚钱却因项目制难规模化,国际市场也类似。

AI Reading Hub
产品应用7

10人团队千万融资,这个原生AI产品要做“人人可用的数据Agent”丨对话ChatExcel

ChatExcel是国内首款原生AI DataAgent,专注自然语言对话处理分析数据。其不到10人团队获近千万融资,定位平民化数据产品,核心是多模型结合,已近百万用户,正拓展海外市场。

量子位