「多模态生成模型」共找到 8944 篇相关文章
盘一下Anthropic 244页Claude Mythos报告中隐藏的SAE技术
Anthropic公布强大危险的大模型Claude Mythos Preview但未发布。文章深挖其244页报告中SAE技术细节,包括前期探索、技术框架、训练监控、攻击性行为分析及掩盖行为等,助了解模型内部思维。
YOLO26(极速目标检测) + SAM3(精准掩码生成) 搭建一套实用的流水线
文章介绍用 YOLO26 极速目标检测和 SAM3 精准掩码生成搭建流水线。阐述二者原理,给出环境配置、实战代码,分析结果,还介绍进阶优化技巧和常见问题解决方案,适合实时应用场景。
卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地
机器人行业核心问题是让机器在真实世界稳定行动。卢宗青团队论文《Being - H0.5: Scaling Human - Centric Robot Learning for Cross - Embodiment Generalization》给出通用操控路线,系统性解决多形态平台部署问题。
从「找视频」到「产视频」:快手RaG推动推荐系统迈向完全生成时代
快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进到「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。
首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」
港大团队提出FASTER,重新审视动作分块策略的反应延迟问题,提出快速动作采样方法。它即插即用,已开源。通过Horizon - Aware Schedule等创新,降低TTFA、提高闭环频率,实验显示能显著提升VLA反应能力。
告别AI胡说八道,Meta新方法CoVe准确率飙升 28%
大模型‘幻觉’问题一直是‘严肃使用场景’的难题。Meta AI团队提出CoVe新方法,让大模型学会‘自我反省’。该方法通过四步走实现自我纠错,能大幅降低幻觉率,还具备三大优势。
claude code也过气了?opencode+插件彻底火了~
opencode是开源CLI coding Agent,其与oh - my - opencode组合能让订阅的多个模型组队干活。还兼容claudecode,后台agent并行,lsp工具全开,有“ultrawork”魔法词,适合常切换用模型的人。
首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测
现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。
GPT-5.4发布,拥有原生计算机操作能力,像是给OpenClaw量身打造的模型。
OpenAI凌晨发布GPT-5.4,或是4o模型后提升最大的一次。它价格较合理,有原生计算机操作能力,支持100万token上下文,还有工具搜索功能可降47% token损耗,与OpenClaw适配性佳。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华大学的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,让AI“读懂人心”。其框架分三阶段,还有动态社交记忆,在多基准测试表现出色。