「多视角数据」共找到 6025 篇相关文章
一文带你通俗易懂的看懂"人工智能+",这是十年一遇的大机遇。
作者解读《关于深入实施“人工智能+”行动的意见》,对比‘互联网+’指出‘人工智能+’核心是‘赋能’,还阐述其在多领域的应用及影响,最后提醒大家面对挑战抓住机遇。
中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!
中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。
14.9k Star!Firecrawl 开源的 PDF 智能分类器,200 份文档 0.47 秒搞定!
Firecrawl 开源 PDF 智能分类与文本提取库 pdf-inspector,已获超 1.4 万人标星。它能智能分类、感知提取、转 Markdown 及按需路由,性能炸裂,分类快,多项指标领先,还支持多平台。
100 刀订阅的 Claude Cowork,被 GitHub 大神 2 天手搓出「开源升级版」!
Anthropic 的 Claude Cowork 功能强大,但昂贵门槛挡住多数人。开源社区的 Accomplish,开发者 2 天就搓出其开源平替版,还是升级版,能本地运行、支持多模型。
成本仅0.3美元,耗时26分钟!CudaForge:颠覆性低成本CUDA优化框架
CUDA代码性能对模型训练与推理重要,但手动优化门槛高。明尼苏达大学团队提出CudaForge,是低成本多智能体CUDA Kernel生成与优化工作流,实验效果好,成本低且具通用性。
Qwen 3 VL 模型已并入 llama.cpp,ollama同步支持
近日,Qwen 3 VL 系列模型合并到 llama.cpp 项目,支持图像输入和多轮对话,解决了架构兼容性问题。功能已入主干分支,运行需足够资源。Ollama 最新版同步支持其本地化。
刚刚,新一届ACM博士论文奖正式公布
近日,新一届 ACM 博士论文奖公布,含一个博士论文奖和两个荣誉提名。获奖论文探讨人机协作解决心理健康问题,荣誉提名论文分别聚焦计算模型局限性及大模型数据利用。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源
上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。
Chroma创始人「Context Engineering」5 步杀疯全网
文章聚焦Chroma创始人提出的「Context Engineering」,指出RAG已死,上下文工程崛起,还给出实用建议,如聚焦检索、混合召回等,介绍了上下文工程包含的数据摄入、查询等内容。