「跨视角视觉理解」共找到 1460 篇相关文章
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。
重磅!iPhone 端侧可部署 Gemma 4 了!完全零token消耗!
PhoneClaw 是运行在 iPhone 的本地 AI Agent,可离线运行 Google Gemma 4。它支持多模态,有隐私保障和灵活模型管理。文中介绍使用方法、自定义 Skill 方式、常见问题,还提及后续扩展计划。
不想买几百刀的 ChatGPT Pulse?这款开源替代 + 本地部署可以白嫖试试
MineContext是开源跨平台桌面应用,可把电脑操作变成“上下文记忆库”。它能自动收集信息、生成总结和待办等。有自动截屏、生成总结等功能,使用体验好,适合常忘工作内容的信息工作者。
腾讯把IMA知识库开源了!WeKnora支持Agent调用、MCP协议扩展,企业级RAG零成本落地
腾讯开源WeKnora,这是面向复杂异构文档的LLM框架,走完整RAG流程。它有Agent模式,支持多种知识库类型和格式,有Web UI。适合公司、研究者、开发者等,还给出了上手步骤和部署提醒。
AI大佬教你如何中顶会:写论文也要关注「叙事」
NeurIPS投稿截止不到一月,Google DeepMind的Neel Nanda发布机器学习论文撰写指南,旨在解决论文表达晦涩问题。指南涵盖理想论文精髓、写作关键要素、结构解析、流程建议及常见问题应对策略。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
人大系团队、天使轮数千万元融资,境瞳科技给人类社会建一个「世界模型」
境瞳科技获数千万元天使轮融资,要给人类社会建「世界模型」。其社会模拟器已有超 1350 万个 AI Agent,是全球同类系统中规模最大、置信度最高的。社会智能赛道在硅谷已吸引大量投资,国内境瞳科技是该领域唯一产学研团队。
Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小
Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。
NanoCoder:我把50万行的claude code核心机制浓缩成1000行,不可能学不会了吧!
Claude Code 源码泄露后,kimi Agent 团队何宇峰大佬的 NanoCoder 项目,用 950 行 Python 代码重写其核心机制。它实现 7 种关键设计模式,可助理解顶级 AI 编程 Agent 核心设计,还能按需修改。
DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!
大模型赛道热闹,架构创新多,理解困难且缺清晰架构图。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线图谱「LLM Architecture Gallery」,方便研究者查阅对比。