「视觉原语」共找到 871 篇相关文章
Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小
Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。
OpenAI重组GPT-5「灵魂」团队!亚裔女负责人遭调离,罕见自曝AI幻觉祸首
OpenAI进行重磅结构调整,ChatGPT「模型行为」团队并入Post - Training,前负责人Joanne Jang负责新OAI Labs。同时,OpenAI揭秘AI产生「幻觉」的罪魁祸首是「应试」评估体系。
这个 4o 矢量插画提示词效果太好了
该 40 矢量插画提示词效果出色,适合张扬的产品主题插画,色彩一致、线条粗,便于转换成 SVG,还给出了具体提示词内容。
ACL 2025|自我怀疑还是自我纠正?清华团队揭示LLMs反思技术的暗面
本文指出反思技术虽简单有效,但在多种LLMs和任务中会失败。清华团队剖析其在开源和闭源LLMs、四种任务上失败原因,提出轻量级缓解方案,为反思技术可解释性研究奠基。
Hugging Face开源顶级模型:双模式推理+128K上下文,最强3B
今天凌晨,Hugging Face开源顶级小参数模型SmolLM3,参数30亿,性能超同类。它有128k上下文窗口,支持6种语言、双推理模式。架构细节等全开放,联合创始人强烈推荐,称是3B领域SOTA。
代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放
检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画
商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。
懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5
阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。