「视觉故事讲述」共找到 843 篇相关文章
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。
具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023
本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。
杨植麟预告,Kimi K3要来了
月之暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
设计师的 ChatGPT 时刻:Figma 这次把“设计即代码”玩成现实
文章介绍了AI编程产品分类,指出Vibe Coding存在的问题。重点讲述Figma在2025 Config发布Vibe Coding产品Figma Make,其可从设计稿生成网页,有编辑工具精准迭代等功能,还推出可视化低代码建设工具Figma Site。
给机器人打工了一天,我们体验上了AI时代最魔幻的工作。
本文讲述作者公司小伙伴达达体验给具身智能做数据采集工作的经历。具身智能数据获取难,催生数据采集员岗位。达达面试顺利,工作时先觉新奇,后感手腕酸,日薪200 - 250元,凸显AI进步背后普通人的贡献。
具身智能迎来“安卓时刻”,一位清华博士决定给机器人换脑|甲子光年
千诀科技CEO高海川讲述其打造的具身智能系统,可脱离特定硬件载体,安装到不同机器人。公司跳出端到端VLA束缚,选分区预测式世界模型,目标是打造“机器人领域的安卓系统”,还认为家庭场景比工业场景易落地。
三年时间市值翻了25倍,广告新巨头AppLovin任命了一名华人CTO
在Google和Meta“垄断”的广告领域,AppLovin成为新巨头。新任CTO葛小川分享工程数据,该公司基于机器学习的广告竞价系统日处理超1000亿次请求,核心工程团队不到100人。文章讲述其发展历程、技术突破及未来规划。
浏览器自动化:从GUI到OpenCLI
文章讲述放弃不稳定的前端UI自动化操作,采用解析并复现底层API请求的方式,来解决浏览器自动化的效率与稳定性难题。介绍了OpenCLI思路、使用方法、原理,还提及自动生成CLI及应用案例,指出未来软件竞争维度将转向可调用性。
对话「哈萨比斯传」作者:“他不喜欢奥特曼”
《哈萨比斯:谷歌AI之脑》作者塞巴斯蒂安·马拉比与量子位深度对谈,探讨书中细节与幕后故事。哈萨比斯不喜欢奥特曼,追求知识科学,与奥特曼价值观不同,书中也谈及他成长、错误及面临的困境。