「视觉 AI」共找到 10112 篇相关文章
百度:和大家一起讲 「超级有用」的故事
作者参加百度AI DAY智能云创新行业专场,看到百度全栈AI解决方案矩阵及应用案例。百度通过构建生态、全栈自研、推动科技平权等举措发力AI,诸多应用已取得商业成果,有望在AI商业化长跑中胜出。
又一个Genie 3来了!刚上线挤爆服务器,Mirage 2把世界模型玩成在线游戏
全球首款AI原生UGC游戏引擎Mirage迎来2.0版本。它能将图像转为可互动3D世界,还能用文本重塑。和Genie 3相比控制类别更丰富,虽有进展但仍有动作控制、视觉稳定等问题待解决。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
苹果密谋300亿美元天价收购Perplexity,小扎狂挖印度裔CEO!
AI战火正旺,苹果考虑收购估值140亿美元的AI初创公司Perplexity,这或成其史上最大规模收购。Perplexity有实时联网的AI搜索引擎等,苹果有三种合作设想,但三星或抢先合作。此外,Meta曾想收购Perplexity,后投资Scale AI。
生财有术小连:微信问一问蓝海机会,用搜索玩法抢占流量先机
生财有术小连分享微信问一问运营经验,指出其支持真人分享、有“去AI化”特点及“强SEO搜索、排名”机制。介绍视觉霸占、抢词根等玩法,还给出内容与ID绑定等运营建议,称当前是SEO玩法的蓝海时期。
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。
我承认,我还是把AI应用想简单了
过去我们把AI应用想得简单,仅定义为聊天框等。生成式AI可构造全新产品逻辑,催生AI原生应用。‘1000 AIdea应用计划’涌现诸多创意作品,如火星种土豆、星童伙伴等,6月20日上海峰会将展示成果。
18 岁创业者用 OpenClaw 管 16 个 AI Agent,一个人的 Agent 公司怎么运转
18岁无编程背景创业者用OpenClaw搭建多Agent协作平台,16个Agent分工明确,配合Claude、GLM等工具提升生产力。他分享工作流搭建、成本、模型选择等经验,还谈了对OpenClaw发展的看法。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。
分享6个平时我最常用的Prompt心法。
作者作为常靠AI帮忙的普通用户,分享6个与AI对话的心法技巧。包括让AI选角色回答、回答前追问、与AI辩论、预演失败、反向推提示词和双层解释法,助大家与AI有效协作。