大模型数据」共找到 9982 篇相关文章

开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为模型开发的“万能钥匙”

模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
新闻资讯7

小米小爱同学:资源受限下,实现端侧模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,了解其团队在资源受限的端侧设备实现模型高性能推理的策略。目前端侧模型商业化落地慢,团队提前布局,自研框架,实现超180 tokens/s推理速度,还分享未来突破方向。

InfoQ
算法论文8

ChatGPT到底学了多少「污言秽语」?清华团队首提语言模型中文语料污染治理技术

清华等团队研究发现,先进ChatGPT系列模型中文词表污染达46.6%,含色情、赌博等词元。团队定义分类中文污染词,构建识别模型,还能由词表污染估计数据污染,为语料治理提供方案。

机器之心
算法论文8

清华刘知远团队:高质量LLM训练数据获取新方法!成本降90%,性能提升

清华刘知远团队论文提出全新数据筛选方案,解决传统数据筛选验证慢、主观性强问题。发明‘半成品加工法’降成本,用fastText筛数据,筛出Ultra - FineWeb数据集,提升模型性能,还计划拓展到专业领域。

深度学习自然语言处理
算法论文8

挑战 1 比特!ETH Zürich 秦浩桐:如何把模型「塞进」小设备?| IJCAI 2026

IJCAI 2026会上,秦浩桐给出创新解法,挑战无需重训的“后训练量化”极限,将庞的LLM强行压缩至极端的1比特与2比特。其团队的BiLLM与SqueezeLLM打破了后训练量化魔咒,还指出极低比特量化的三挑战。

AI科技评论
开源动态8

探针伸进模型黑箱,南加州学华人团队打造AI记忆研究的深空望远镜

南加州学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。

DeepTech深科技
新闻资讯7

比起让模型写 100 万字的小说,AI 牛们更想用 AI 拿诺贝尔奖

OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据模型、应用层。

AI科技评论
算法论文8

提升模型内在透明度:无需外部模块实现高效监控与自发安全增强|上海AI Lab & 上交

语言模型能力提升引发风险担忧,当前主流用外部“黑盒”监控模块解读模型表征,存在诸多局限。上海人工智能实验室和上海交通学团队提出TELLME方法,摒弃外部模块,提升模型内部透明度,还提升了输出安全性。

量子位
推荐文章8

小白也能看懂,一文彻底说清 MCP、A2A与AG-UI,模型应用集成协议三件套。

文章面向有一定技术基础但不熟悉模型应用开发的读者,通俗介绍MCP、A2A和AG - UI三主流集成协议,分别解决不同的集成难题,三者构成模型应用集成完整生态。

AI大模型应用实践
算法论文8

ICLR 2026 Oral | 没人诱导,模型也会「骗人」

新加坡国立学 Bingsheng He 教授团队论文关注无诱导下模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。

机器之心