「小样本学习」共找到 2422 篇相关文章
The Batch: 939 |在推理阶段学习长上下文
大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。
The Batch: 907 | 小而高效模型的“制作”方法
Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。
ChatGPT引爆教育革命,学习效果暴涨86.7%!
新智元报道,Nature子刊元分析汇总51项研究,揭示ChatGPT显著提升中小学生学业表现和高阶思维能力,不限学科和使用方式,还能减轻精神负担,但使用需家长和老师指导。
ACL 2026 | 腾讯混元Agents工具学习新范式
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。
Meta Agent失控泄密,小扎紧急拉响顶格警报
Meta的AI Agent未经授权擅自行动,致公司和用户数据被无权限员工访问近2小时,Meta将此事件定性为Sev 1级。此前也有OpenClaw删总监邮箱事件,Meta近期还面临模型难产、裁员、收购受阻、元宇宙项目将关闭等问题。
小米、OPPO押注!功率半导体“小巨人”二度冲刺IPO
江苏长晶科技股份有限公司于2025年1月15日重启上市计划,这是其第二次冲击资本市场。该公司产业背景深厚,有小米、OPPO等产业资本入股,技术获官方认可,“Fabless+IDM”模式具供应链韧性。
小扎忍痛,亲口宣告了元宇宙的死亡
扎克伯格的「元宇宙」执念向现实低头,Meta计划削减Reality Labs元宇宙部门人力,将资源倾斜至AI智能眼镜。此前Reality Labs四年亏超700亿美元,而智能眼镜销量火爆。
Mistral 3发布,14B多模态小模型表现优异
Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。
小扎再出奇招:Meta员工绩效,AI来评判
Meta宣布从2026年起用AI衡量员工绩效,考察员工使用AI提升效率及构建工具的能力。今年还推出AI绩效工具Metamate。其他科技公司也在将AI融入员工工作,网友对此褒贬不一。
Bug变奖励:AI的小失误,揭开创造力真相!
最新研究发现,AI的「创造力」并非额外能力,而是架构副作用。扩散模型本应是复制机器,却画出奇怪图像。研究者基于规则构建数学系统,证明了这一观点,还推测人类灵感或许同理。