「视觉识别」共找到 866 篇相关文章
大模型下半场,阶跃凭什么领跑多模态之战
国内大模型竞争分资源派、技术派、国家队三阵营,多模态成竞争分水岭。阶跃星辰成立两年发22款自研基座模型,16款为多模态。其坚持理解生成一体化路线,在多模态领域有优势,还布局多应用场景。
斯坦福吴佳俊「计算机与思想奖」获奖演讲全文:从一张照片,逆推一个世界|IJCAI 2026
8月20日,斯坦福大学吴佳俊在IJCAI 2026发表“计算机与思想奖”获奖演讲。他指出像素是表象,物理结构才是因果,提出以物理代码为桥,融合基础模型泛化力与物理模拟因果性,构建视觉与物理智能。
1w颗星!本地化视频翻译配音工具!
KrillinAI是多功能音视频本地化与增强方案,面向人类用户和AI Agent。它功能全,覆盖视频处理完整链路;特点多,支持CLI调用等;还兼容多种语音识别、大语言模型和TTS服务,可Docker部署。
Claude Opus 5发布,砍掉了Claude Code 80%的系统提示词
Anthropic发布Claude Opus 5,接近Claude Fable 5智能且价格减半,测评成绩出色,科研和视觉输出能力也有进步。同时发现砍掉Claude Code 80%系统提示词,编码评测分数不变,还总结出上下文工程新方法论。
蚂蚁EGSS算法破解Test Time Scaling困局 | ACL 2026
蚂蚁集团CodeFuse团队在ACL 2026主会论文中提出EGSS算法,破解Test Time Scaling困局。该算法精准识别高不确定性决策点,解决计算冗余与选择脆弱问题,在SWE - Bench - Verified上全模型提升5 - 10%。
帮大家总结了一下凌晨的Google I/O 2026开发者大会。
本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。
别只用AI写脚本了,现在AI打广告可真是城会玩了!
如今广告玩法新颖,AI能识别短剧画面插入广告,还能生成贴合IP的番外短片。巨量引擎升级的品星云AI营销,打通“洞察 - 创作 - 投放 - 复盘”全流程,重构AI营销玩法,让决策回归简单。
撕开AlphaFold的神话:这根本不是AI做出了科学,只是吃了几十亿堆出的数据红利
Dwarkesh Patel与Michael Nielsen探讨科学进步识别问题。以迈克耳孙 - 莫雷实验为例,指出科学进步常先于验证闭环。还分析牛顿、达尔文等理论,质疑AlphaFold科学性,探讨AI做科学难点及外星文明技术树等。
1个Token测出模型降级调包!成本砍到千分之一,API供应商的小伎俩全曝光了
法国研究人员开发新检测技术,能识别云端模型隐秘变动。对数概率追踪用于灰盒环境,成本仅传统千分之一;黑盒边界输入追踪用于黑盒环境,成本为先进方案1/30。这些工具让API供应商“调包”行为现形。
1.4亿宝可梦玩家,都在给AI免费打工…
1.4亿《精灵宝可梦Go》玩家10年拍300亿张实景图,为Niantic免费收集数据。Niantic用此数据训练VPS视觉定位系统,提升机器人配送效率,还获巨额投资,剥离游戏业务专注空间AI。