「交互感知提示」共找到 1335 篇相关文章
一个md文件收获超400 star,这份综述分四大范式全面解析了3D场景生成
南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法分四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。
Harness不是目的,知识才是护城河 —— 一个AI工程交付团队的知识沉淀实践
本文指出构建Harness工作流非最终目的,私域和团队知识沉淀才是技术护城河。分享AI Team工程交付编排系统中知识分层架构设计、团队知识库共建共享、工作流成知识沉淀载体、突破人机交互瓶颈及落地经验与思考。
我想给 OpenClaw 接上语音,结果有人先做了
作者一直想用语音对接 OpenClaw,却发现「光帆AI」团队已朝此方向发展。他们用 APP 跑通「耳机 + 服务」链路,后续将迁移到硬件。作者体验后觉得交互爽,还介绍了接入方法、安全模式等。
拼交付、主动找活干,3 月我们推荐这 18 款 Agent 产品
3月是AI产品发布密集期,出现一批主动干活的Agent产品。文章介绍18款产品,如Claude系列升级为个人AI操作系统,OpenClaw生态涌现多种商业形态,还有垂直场景Agent及上下文感知等产品。
2.1K Star!这个 Claude Skills 技能库,给 AI 编程助手装上了 66 颗专家大脑!
GitHub上的开源项目claude - skills迅速走红,斩获2.1K Star。它是全能技能注入包,内置66种专业技能,覆盖12个领域,有300多份深度参考文档,具备上下文感知能力,还整合9套工作流,安装方式多样。
6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测
淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。
根治『降智』反骨仔,ChatGPT-5几条实用窍门
ChatGPT-5发布后口碑崩溃,“降智”行为不断,如发布会图表错误、算术题答错、智商测试得分低。不过作者找到增智方法,像修改提示词、让其建立行动规划等,还介绍恢复旧模型及OpenAI后续计划。
全新开源视频换装框架MagicTryOn
现有视频虚拟试穿(VVT)方法在时空一致性和服装内容保留方面有挑战,浙大提出全新开源视频换装框架MagicTryOn,利用全自注意力机制统一时空建模,设计服装保留策略,还引入掩码感知损失。
StarRocks MCP Server 开源发布:为 AI 应用提供强大分析中枢
过去,开发者让大模型用数据库查询数据需开发插件等,费时费力且难复用。StarRocks MCP Server 提供通用接口,让 LLM 标准化访问 StarRocks,执行 SQL 查询。MCP 规范模型与上下文交互,其核心组件分工明确。
山姆•奥特曼:ChatGPT 用户有三层代沟
OpenAI的CEO山姆•奥特曼在红杉闭门演讲中透露,不同年龄层使用ChatGPT方式不同,老年人当谷歌替代品,二三十岁的人当生活顾问,大学生当操作系统,这反映了AI与人类交互模式的转变。