「网页提取」共找到 263 篇相关文章
RPA已死,微软Playwright MCP开启AI自动化革命
文章指出RPA已落后,微软Playwright MCP开启AI自动化革命。对比传统RPA与Agent+Playwright MCP方式差异,介绍Playwright MCP优势,还给出15分钟上手步骤及多个使用案例。
字节开源多模态复杂文档解析模型!Dolphin:页面与元素并行解析,精准解析复杂文档!
多模态AI与文档解析兴起,传统OCR解析复杂文档常出错。字节跳动开源多模态模型Dolphin,通过两阶段机制精准解析,有多种功能,安装使用友好,适用于多场景,降低了复杂文档解析门槛。
好哇,缩短了设计与代码之间的差距。
Cursor更新可视化编辑器,输入`@Browser`即可使用。可拖动页面元素改结构,用控件调样式,还能描述更改内容、测试组件状态,缩小设计与代码差距,比Claude Code更便捷。
真正能离线跑的完全开源翻译工具
Argos Translate是用Python写的开源离线翻译引擎,底层靠OpenNMT,推理用CTranslate2。可当库、命令行、桌面软件用,模型是本地zip包,不联网也能用。支持主流及小众语言,有多种使用方式。
大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?
大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。
JSON 瑞士军刀,效率直接起飞!
现在很多接口、日志、配置文件用JSON,数据结构复杂时处理麻烦。`jq`是专门处理JSON的工具,支持格式化、过滤、提取等操作,语法简单,在多场景常见,安装方便。
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
港大开源 Paper2Slides,一条命令,把论文变成专业幻灯片!
在AI辅助办公赛道,PPT生成一直是竞争热点,但存在好看不好用、好用不准确的问题。港大开源的Paper2Slides项目,能一条命令把论文转成专业幻灯片,还能做海报,解决了AI幻觉问题。
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。
一个强大的知识图谱生成工具
这是基于Streamlit的应用程序,用LangChain和OpenAI的GPT模型从文本提取图谱数据并生成交互式图谱。有两种输入方式,具备可视化等特性,还给出安装、运行等指南。