「视觉智能」共找到 3964 篇相关文章
一句话画出整张架构图?这款 2k star 开源 AI 画板,真能帮你告别熬夜改流程图吗?
Smart Excalidraw是基于Excalidraw的智能绘图工具,用自然语言就能绘制专业图表。它能解决传统绘图语法难记、排版耗时等痛点,具备AI驱动、独创连接算法等功能,适合多类人群使用。
2025AI红利爆发!新智元创始人与5位清华系大咖「探索对话」
11月5日,「新浪新闻・2025探索大会」举办,新智元创始人杨静主持探索对话环节,多位嘉宾围绕「如何掌握科技创新的时代红利」展开交流,探讨释放红利路径,还提及协同创新和出海对放大红利的重要性。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
跟这个音乐Agent聊会儿,分分钟生成抖音神曲 | 对话音乐创作Agent产品Tunee
量子位智库对话国内首个音乐创作Agent产品Tunee负责人贾朔,探讨了产品适配用户群体、核心交互形式、解决需求模糊性等问题,还提及产品价值、迭代方向及推出智能硬件的原因。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
7.5K Star!HKUDS开源AI全栈开发框架,产品经理的Demo神器!
AI时代从论文到产品Demo开发全链路工作耗时费力,现有Agent也有诸多问题。香港大学数据科学实验室(HKUDS)开发的DeepCode开源框架,定位“全自动AI软件开发框架”,可一键从论文/需求生成完整项目,已获7.5K Star。
23.6K star!微软AI项目硬核开源,带飞你的电脑!
微软开源项目 `OmniParser` 是超级智能“数字助手”,能像人一样“看懂”屏幕元素并操作。它精准识别小图标、响应快、开发便捷、兼容大模型且跨平台,目前在Github获23.6K star。
从科学论文自动生成视频
该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。
AI圈“集体开大”!DeepSeek、Claude带头,智谱、阿里、蚂蚁、智源都“卷”起来了
双节前最后一天,AI圈“卷”疯了!智谱发布并开源GLM - 4.6,是国内最强Coding模型;阿里介绍视、听、说全模态同传大模型Qwen3 - LiveTranslate - Flash;蚂蚁开源万亿参数推理大模型Ring - 1T - preview;智源开源跨本体基座大模型RoboBrain - X0。