「语义动作流」共找到 612 篇相关文章
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
Figure机器人分拣快递新视频曝光,网友:太像人类
Figure 02机器人开启打工模式,创始人放出其分拣快递新视频,它动作流畅像人类,由端到端通用控制模型Helix自主驱动。此前它还在宝马生产线连续20小时轮班作业,Figure与OpenAI分道扬镳后推出Helix。
ChatGPT又突发俩CEO了?纯属扯淡,根本啥大洗牌
The Verge报道,前Meta高管Fidji Simo将以应用线CEO身份接手ChatGPT等业务。这并非大洗牌,而是OpenAI强化产品端能力的举措。此次调整像架构重构,还可能带来商业化变化,也被视为IPO预备动作。
DeepSeek R1 的小更新,却大有深意?
5月28日,DeepSeek低调宣布R1模型小版本试升级,API接口和使用方式不变,但未公布具体更新内容。从用户反馈看,语义理解、逻辑推理等能力提升,实测表现出色。此次升级或有安全、产品路线等考量。
微调重要表征以增强思维链的推理能力
团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025
来自多高校研究团队提出KineDex框架,以真·手把手指导方式让人类动作传至灵巧手,同步采集高保真触觉信息,使星动纪元灵巧手星动XHAND 1解锁复杂精细操作,论文已被CoRL 2025接收。
紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025
中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。
博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!
近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。
更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要
近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。