「3D任务」共找到 3777 篇相关文章
MIT这篇RLM论文,给出了Scaling的另一种可能~
当大家普遍认为解决长上下文问题要靠扩大模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意大语言模型处理 10 万 +token。
北航领衔发布300页代码智能综述:从基础模型到智能体,一次读懂Code LLM全景图
北航领衔联合近30家机构撰写《From Code Foundation Models to Agents and Applications》,系统梳理代码智能领域,串联模型、任务等成完整技术链路,还通过实验等给出实践指南。
解放双手!开源 AI 桌面智能体
桌面智能体Bytebot是拥有专属计算机的人工智能,有完整虚拟桌面。它能使用任意应用、处理文档等。赋予AI独立计算机可解锁新能力,项目地址为https://github.com/bytebot-ai/bytebot。
刚刚,谷歌发布机器人最新「大脑」模型!思考能力SOTA,还能「跨物种」学习
谷歌旗下DeepMind发布Gemini Robotics 1.5系列模型,包括Gemini Robotics 1.5和Gemini Robotics - ER 1.5,能让机器人学会‘思考’,还可跨具身形态学习技能,有望开启通用机器人新时代。
Claude for Chrome来了!可作为浏览器扩展程序直接使用
Anthropic发布浏览器agent Claude for Chrome,可作Chrome扩展程序使用,能设日历、回邮件等。目前仅向1000名Max套餐用户开放,因使用浏览器的AI有安全挑战。AI浏览器成巨头争夺战场。
英伟达让机器人「做梦学习」,靠梦境实现真·从0泛化
英伟达推出DreamGen项目,让机器人‘做梦学习’。它利用视频世界模型生成神经轨迹,仅少量现实视频就能让机器人学会新任务,实现从0泛化,还将助力GR00T - Dreams发展。
Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小
Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。
陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年
今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。
2.4K Star!小米最新开源!覆盖600+语种的语音克隆TTS,40倍实时合成速度!
小米k2 - fsa团队开源OmniVoice,这是支持600 + 语种的零样本语音克隆TTS模型,性能超ElevenLabs v2和MiniMax等标杆,RTF低至0.025,合成速度快40倍,还支持声音设计等功能。
终于在国产AI上看到了Opus的影子|GLM-5深度实测
作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。