「视觉-语言-行动模型」共找到 1727 篇相关文章
EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?
近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。
比Claude效果更好、且便宜近 100 倍?xAI祭出“白菜价”AI编码模型掀桌子!网友:便宜没好货
xAI 推出编码助手模型 Grok Code Fast 1,采用新架构,有强大全栈开发能力。价格低,在性能与成本间取得平衡。用户评价不一,它在日常开发场景性价比高,与其他竞品各有优势。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!
AI编程助手市场看似火热,实则盈利艰难,如Cursor等工具亏本运营。Cline选择开源,坚持软件免费、服务变现,一年成爆款。其创始人分享了产品理念、技术选型、市场定位等,还探讨了MCP生态、编程智能体发展等话题。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
中国足球还是靠机器人吧!首届机器人运动会闭幕:票价终究保守了
世界人形机器人运动会闭幕,清华火神队1-0胜德国队获机器人足球赛冠军。赛中有诸多有趣场面,且比赛背后硬核技术拉满,像足球赛用自主行动机器人,胜负关键在算法。
最惨就业季!CS学霸GPA 3.98,投2500份简历仅10次面试,AI吞噬入门级岗位
CS应届学霸Kenneth Kang GPA近满分,海投2500份简历仅获10次面试,其同学还有失业两年未上岸的。AI“夺走”初级岗位,企业偏爱“即插即用”员工,人才培养链断裂,引发技能鸿沟等问题。
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
LeCun出手,造出视频世界模型,挑战英伟达COSMOS
训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。