「机器人操作学习」共找到 2660 篇相关文章
AI coding 智能体设计
文章从分析Gemini - CLI源代码入手,解读AI coding工具智能体设计。涵盖用户提示词预处理、工具注册与调用、架构设计、预置提示词等内容,还对比了Gemini - CLI和Claude Code可扩展性设计,介绍规约驱动开发模式。
Qwen-lmage-Layered:图片分层 指哪改哪
全新图像生成模型Qwen-lmage-Layered采用自研架构,将图片“拆解”成多个图层,各图层可独立操作。其提出新编辑思路,有RGBA - VAE等亮点,支持灵活迭代分解,能实现精准高效的图像编辑。
DeepSeekV3.2技术报告还是老外看得细
ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。
学生3年投稿6次被拒,于是吴恩达亲手搓了个评审Agent
机器学习大佬吴恩达为投稿屡被拒的学生,做了免费AI论文评审智能体。它在ICLR 2025审稿数据训练,与人类审稿相关系数达0.42,能按会议风格评审,还提修改建议,可体验。
罗福莉首个小米成果!开源具身大模型
正式入职小米不到10天,罗福莉作为核心作者的首篇论文出炉。MiMo团队提出并开源全球首个打通自驾与具身操作领域的跨具身基座模型MiMo - Embodied,在29个Benchmark上霸榜。
投85份简历0 Offer!CS研究生心态崩了,亲历20年最猛裁员潮
今年美国裁员破百万,十月裁员规模创2003年来同期新高,AI成背后推手。一机器学习研究生狂投85份简历无果,微软等巨头也加入裁员潮,却仍能实现收益递增,出现“无就业增长的繁荣”。
预训练就学会思考!字节、北大等用14亿参数,撬动百亿模型推理能力
字节、北大等联合发布Ouro模型,用14亿参数实现百亿级模型推理能力。它在预训练阶段学会循环思考,通过三大创新构建推理能力,在基准测试中表现优异,实现参数效率提升,是潜在推理范式的胜利。
AI首胜人类博士,顶会论文秒变代码!港大90后开源刷爆8k星
香港大学黄超团队开源的DeepCode,能分析论文、生成可运行代码。在四大基准测试中全面领先,首超人类专家,还优于现有AI Coding。它有三大核心能力,采用三阶段框架实现代码自动转换。
3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B
文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。
斩获7.4K标星!NotebookLM的终极开源平替,私有化多模态播客一键生成!
Google的Notebook LM虽能上传资料一键生成播客总结,但有数据隐私等问题。近期GitHub上的Open Notebook获7.4K标星,它复制并超越前者功能,强调数据主权,有多项亮点且部署灵活。