「视觉自监督学习」共找到 2005 篇相关文章
AI赛博活佛Andrej Karpathy最新访谈:我学到了他最核心的思维方式
10月17日的Dwarkesh播客访谈里,AI科学家Andrej Karpathy分享思维方式、对AI发展的思考及做AI教育的思路。他用“一阶项”思维抓核心,教学先让学生经历问题,还提出知识可能拖累模型等观点。
刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT
Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
颠覆互联网的下一波浪潮:Agentic Web来了!
本文介绍全新范式 Agentic Web,它由 AI 智能体组成,用户发目标,AI 自动完成任务。文章从多方面解析这场范式革命,还阐述应用场景、面临挑战,指出其是互联网重大转折,但落地需解决诸多难题。
AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击
Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
微软研究院BioEmu登上Science,用生成式AI重塑蛋白质功能研究
7月10日,微软研究院AI for Science团队在《Science》发表成果,提出生成式深度学习模型BioEmu,结合多类数据训练,能模拟蛋白构象变化,有多项核心创新,已开源,未来将拓展应用场景。
只用2700万参数,这个推理模型超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。
谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖
Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。
Gartner:到2029年,50%的云计算将用于AI工作负载
全球著名咨询调查机构Gartner公布未来4年影响云计算增长的几大趋势,如对云不满、AI/机器学习需求增加等,还给出各趋势的预测情况及应对建议。