「视觉推理功能」共找到 4004 篇相关文章
3.3k星星!用AI做前端动效最好的开源项目,给AI写前端代码注入灵魂
现在AI编程做的前端效果不佳,页面不生动、特效生硬。而Text-to-Lottie开源框架可通过AI编程Agent快速生成生产级Lottie动画,支持多种输入,有实时预览与编辑功能,还能集成多平台,简化动效开发。
14.8K Star!这个开源 Skill,一句话就能做出大厂级设计!
Anthropic 发布的 Claude Design 虽能在对话框生成网页,但需手动操作。有人据此开发了开源项目 Huashu Design,可在 agent 里打一句话,3 到 30 分钟就能拿到能交付的设计,还介绍了其功能、核心规则等。
豆包输入法Mac版正式上线,所有人都该试试AI语音输入了。
豆包输入法Mac版正式上线,作者推荐大家用其语音输入与AI对话。如今语音输入法渐成熟,能提升输入速度与质量。豆包输入法免费,体验好,有流式输出、自动纠错、中英混说、轻声抗噪等功能。
开源打破“AI黑箱”!集结全球大咖,GOSIM Paris 2026带你看懂Agent时代大变局
GOSIM Paris 2026在巴黎举办,是面向开发者的开源AI技术大会。大会由GOSIM主办,CSDN等联合打造,聚焦AI能力落地应用。首日Keynote多位大咖探讨AI相关问题,还有三大论坛、工作坊、Hackathon等活动。
无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案
近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。
腾讯开源Cube Sandbox:60毫秒冷启动的AI沙盒运行时
Harness设计中沙箱是重点难点,传统方案在安全与性能间妥协。腾讯开源Cube Sandbox,用RustVMM重构虚拟化层,冷启动60毫秒,单实例5MB内存开销,有真内核隔离等优势,开源版本含网络隔离组件。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
张雪机车燃爆封神!国产2B语音模型重磅开源,全网听完都起鸡皮疙瘩
面壁智能联合多方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供全家桶级工具箱,采用独特技术路线。
Cursor 3 发布:IDE 不重要了,智能体控制台上位,VS Code 这一套开始失效
Cursor 3 发布,用智能体管理控制台取代传统代码编辑器,标志 AI 辅助开发工具与开发者工作流程重大转变。它带来多仓库支持、Cloud Handoff 等功能,转型源于竞争压力,业界对智能体编排层架构设计未达成共识。
论文精选 | 以AI赋能力学:计算力学的智能化之路与未来图景
中国力学学会旗舰期刊AMS推出“力学前沿”专栏,首期解读“计算力学的智能化之路与未来图景”。文章介绍智能计算力学三大范式、面临挑战,还阐述重塑智能框架前沿方向,指出AI与计算力学融合是系统性重构。