「视觉自监督学习」共找到 2005 篇相关文章
具身智能的“生命线”:数据基石与未来路径 | GAIR Live 017
雷峰网举办具身智能数据线上论坛,三位嘉宾探讨其从数据采集到闭环学习全过程。指出具身智能数据挑战严峻,分享真机数据稀缺解决方案,认为仿真合成数据是必经之路,还谈及产学协同、数据服务等内容。
马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化
特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。
混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩
全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。
刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想
GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。
Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题
OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。
社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度
阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在原生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术原理涉及架构、训练与数据。
软件行业“快时尚化”背后的经济学 | AGIX PM Notes
本周市场对软件看法悲观,OpenAI CEO 警告软件或进入‘快时尚时代’。但软件行业会升维,一是从‘死’变‘活’,具备元学习能力;二是定价更极致。还介绍了本周市场总结及多起 AI 相关企业动态。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
只提升2个点?我实测Claude 4.1后,发现官方在骗人
官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。