「视觉逻辑排版」共找到 1045 篇相关文章
Gemini 3 Pro的位置,Kimi K2.5也想坐坐?
Kimi 发布 K2.5,在视觉编程上表现亮眼。它通过多模态训练涌现审美,能生成美观网页。与 Gemini 3.0 对比各有优势,Kimi Code 开源终端 Agent 功能强大,Kimi 还探索 Agent Swarm 协作新路径。
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
17 条举措出台,大步迈进 AI 消费时代!
6月18日,商务部等八部门发布《关于加快“人工智能+消费”发展的实施意见》,文件覆盖广,有三层逻辑,还藏着新信号。不过AI消费落地有挑战,该文件标志AI行业拐点,消费时代序幕已拉开。
CVPR 2026 视频模型趋势梳理:不止生成下一帧,更要理解下一步
视频智能正从画面生成走向运动控制、动态建模等。CVPR 2026 显示视频模型竞争重心从视觉质量转向对时空和物理规律的建模能力,文中介绍多篇相关论文及成果。
Cursor即将被收购、Figma股价大跌,模型厂商还会吃掉谁?AI应用存在护城河吗?
SpaceX 或 600 亿美元收购 Cursor,Anthropic 上线竞品致 Figma 股价跌 7%。AI 应用公司原以为的数据飞轮、垂直 fine - tune、AI 原生 UX 等护城河逻辑已松动,威胁或来自模型供应商。
实锤了,Meta 正式收购 Manus
近日,Manus 官网官宣“加入 Meta”。Manus 致力于打造通用 AI Agent,能处理复杂任务。这是笔待完成交易,未披露条款。Meta 在 AI 落地应用缺具象答案,收购它或是选已跑通逻辑的产品融入底层。
GPT-5.2发布,OpenAI十周年纪念版更新。
OpenAI在成立十周年之际发布GPT-5.2。此次更新让其在真实工作场景更实用,包括PPT/表格制作能力升级、前端编码能力惊艳、视觉能力细节处理更强、工具调用意识领先等。
字节跳动Seed1.5-VL复杂图表精准抽取,Deep Think是多模态未来的主流
文章介绍字节跳动的Seed1.5-VL模型,它能精准抽取复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,预训练语料丰富,后训练结合多种方法,推荐在huggingface体验。
谁在幕后操控特朗普2.0?PayPal黑帮与“科技共和国”野心 | 赠书福利
2025年特朗普启动国家级AI发展计划,背后是硅谷技术精英。他们用资本等重塑美国权力逻辑,核心是彼得·蒂尔。“技术加速主义”思潮兴起,主张技术进步解决问题,亚历山大·卡普构想“科技共和国”。
豆包也开始抢程序员饭碗了,首个编程模型来了!
字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。