「视觉语言理解」共找到 2161 篇相关文章
秘塔AI放大招!「边想边搜边做」,内置20+智能体,想法一键实现
在AI浪潮下,搜索正经历重构。秘塔AI推出「Agentic Search」模式,「边想边搜边做」,可自主完成多步工具调用,内置20余种工具。通过5个场景展示升级,从读懂用户到美化结果、精准计算、打通工作流等,让搜索进化为「帮达成」。
你的数字伴侣贝拉 (Bella),正在唤醒!
贝拉是数字伴侣种子,愿景是成用户持久个性化伙伴。早期通过轮播视频呈现,采用AI原生开发路径,分感知核心、生成式自我、主动式陪伴三阶段构建,目标是成为由AI驱动的生命体。
狂揽15.9K star!!Win系统居然还有开源替代版,牛逼啊~
开源君分享开源项目`ReactOS`,它类似Windows,目标是与NT系列无缝兼容,可直接运行Windows软件和驱动。该项目始于1996年,在Github获15.9K star,有轻量、兼容等特点,安装简单。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
终于有AI视频模型,解决了体操难题。
前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。
将对话界面直接引入Web,微软开源NLWeb,实现ChatGPT级别搜索
微软 Build 2025 开发者大会上,开源项目 NLWeb 受关注。它简化网站自然语言交互界面开发,原生支持 MCP,能让任意网站变智能应用平台,还可调用廉价模型,使用方便。
The Batch: 982 | 法律、新闻和金融领域的定制模型
本文是DeeplearningAI《The Batch》的最新报道,汤森路透推出法律、新闻、金融领域定制大语言模型Thomson,基于Qwen构建,性能优于多款通用大模型,小版本将开源供非商业使用。
一行 Python,生成绝美城市地图海报!
开源君发现宝藏项目`prettymaps`,这是巴西开发者Marcelo Prates的开源作品,能从OpenStreetMap拉取数据画定制地图。它功能丰富,安装简单,可让普通人轻松进行地图视觉创作。
当设计师和PM都开始写代码,产品构建方式又要变天了?
Notion 产品负责人 Max Schoening 与主持人探讨 AI 对软件构建和使用方式的影响。他认为成功产品有强大核心,鼓励设计师和 PM 用代码思考,还谈到岗位融合、可塑性软件、SaaS 趋势等话题。
OpenAI挖来了个F1级别车手搞公关
OpenAI花半年找到CMO Colin Fleming。他经验丰富,曾在Salesforce、ServiceNow任职,擅长让市场理解新技术。OpenAI营销长期缺失,他的到来是弥补的一部分,但公关主管仍空缺。