「多模态框架」共找到 2414 篇相关文章
比 BeautifulSoup 快 784 倍!这个自适应爬虫框架,我愿称它为下一代 Web Scraping 标杆
文章介绍了自适应Web Scraping框架Scrapling,它能解决爬虫从能跑到跑得稳的问题,具备极速爬取、自适应解析等核心功能,适用于电商数据采集等场景,还给出使用方法和项目地址。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级
MIT提出新强化学习框架SEAL,可让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。
每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率
微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。
SIGCOMM 2026 | 从「人眼看视频」到「AI理解视频」:北大提出面向AI的实时通信框架Artic
AI 正从「文字聊天」走向「边看边聊」,传统实时视频通信难以满足需求。北大团队提出 Artic 框架,重构码率自适应等,实验显示其能显著提升准确率、降低延迟。
腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型
多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。
首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合
SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。
不写Prompt,连按Tab完成重构:蚂蚁CodeFuse团队提出无指令代码编辑框架NES
在AI coding工具快速演进的当下,蚂蚁集团CodeFuse算法团队在FSE 2026提出无指令代码编辑框架NES。它从历史编辑轨迹学习开发者意图,有双模型架构,实现分三环节,重构交互链路,提升开发者体验。
32B逆袭GPT-5.2:首个端到端GPU编程智能体框架StitchCUDA问世
现有LLM自动化CUDA方法难处理端到端GPU程序,StitchCUDA提出多智能体框架+基于Rubric Reward的Agentic RL方案,分解任务、优化训练,在实验中成功率和加速比远超其他方法,解决Reward Hacking问题。