「多模态查询」共找到 996 篇相关文章
Sand.ai重磅更新MagiAttention,正在定义分布式Attention性能新标杆
2025年4月,Sand.ai开源MagiAttention v1.0.0。如今发布v1.1.0,适配Blackwell新架构,构建原生Group Collective原语,经系统级协同优化,在多模型训练中得到实证,展现卓越性能。
28.2k+ star,这个终端历史增强神器绝了!
开源君发现开源Shell历史管理工具Atuin,它用Rust编写,将命令结构化存到SQLite数据库,记录丰富上下文信息。兼容主流Shell,有专属搜索UI,功能强大,安装方便,提升命令行历史体验。
DeepSeek 硬核开源 DeepSeek-OCR-2!弃用 CLIP 改用 Qwen,创新视觉因果流!
昨天开源社区热闹非凡,Kimi 发布 K2.5,DeepSeek 则推出 DeepSeek - OCR - 2,用 LLM 架构替换传统 CLIP 视觉编码器。它核心创新是视觉因果流,能智能规划阅读路径,性能高效且全量开源。
NotebookLM 平替来了:开源自托管的 Open Notebook,把资料留在自己电脑里
Open Notebook 是开源自托管项目,是 NotebookLM 平替。它解决了资料隐私、模型选择、可扩展性问题,有多种实用功能,提供两种 5 分钟上手方式,适合资料敏感、折腾模型及程序员等人群。
Llama 4造假丑闻幕后:小扎豪赌143亿,却为中国AI「做了嫁衣」
Meta的Llama 4评测性能造假,OpenAI算力计划引恐慌,全球AI发展陷入困境。中国AI力量爆发,如DeepSeek、MiniMax等,以强大性能、高性价比和商业可持续性满足全球需求,在国际舞台崭露头角。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
Gemini CLI 重磅更新:现已支持音视频处理,并带来多项体验升级
Gemini CLI 迎来重磅更新,带来多项改进。新增音视频输入(暂未正式开启)、增强 Markdown 功能,集成 VSCodium 和 Neovim,技术栈升级至 Ink 6 和 React 19,还有主题更新、隐私管理等优化。
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
Qwen3新成员:Embedding系列模型登场!
今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。