「LingBot-Depth 2.0」共找到 2474 篇相关文章
蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争
蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。
用Claude Code搭建工作流
作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。
字节Seed提出序贯策略优化方法,突破同传“质量-延迟”权衡问题
AI字幕质量和延迟难平衡是业界老问题。香港中文大学、字节跳动Seed和斯坦福大学研究团队提出序贯策略优化框架SeqPO - SiMT,在70亿参数规模实现SOTA,翻译质量媲美Qwen - 2.5 - 7B离线水平。
深度研究白菜化?谷歌将Gemini级AI研究能力开源
谷歌推出'gemini-fullstack-langgraph-quickstart'开源项目,用Gemini 2.5与LangGraph结合,可构建本地运行的深度研究智能代理系统。介绍其技术架构、工作流程、开发配置、部署扩展,还展示了现代AI应用开发趋势。
深度拆解 DeepSeek Harness 架构:AGI 的自进化,终于有了「后悔药」
8月13日,DeepSeek开放DeepSeek Harness v0.1开发者预览版,在Github获4.5万星。它提出“一切皆插件”概念,核心组件可插拔。还联合北大提出Cordis框架,解决组件插拔问题,但面临价格与组件膨胀挑战。
3D版Nano Banana来了!AI修模成为现实,3D生成进入可编辑时代
2026年初市场关注3D生成领域,中国团队Hyper3D发布Rodin Gen - 2 Edit,实现3D模型局部编辑。它支持两种操作路径,将“3D生成”与“3D编辑”整合,还打通主流工作流,源于团队长期技术积累。
刚刚,DeepSeek新模型MODEL1曝光,3处架构升级!
DeepSeek更新FlashMLA时曝光新模型MODEL1,从diff看它在MLA KV-Cache存储与访问方式上和V3/V3.2系列有3个本质差异,如物理排布更紧凑、引入‘extra’两段式cache、头维固定512×512。
对话陈炜鹏:Loopit 有了 1500 万件作品之后,我们决定做自己的互动世界模型
Loopit 今年 2 月上线,已积累近 1500 万作品,北美数十万青少年成稳定用户。在此基础上,团队发布互动世界模型 Zing - 0.5,探索互动内容新形态。陈炜鹏认为模型与应用应结合,自研是为拓展产品边界。
Skills 真的可以帮我干活了:把工单分析变成一个可复用的 Skill
Anthropic推出Skills时未被看好,Claude Code2.1.3版本解决触发难题。作者将工单分析固化成可复用Skills,指出传统思路获取数据难,提出新方案,还对比了Skills和Workflow,强调前者优势。