「文档任务」共找到 2248 篇相关文章
拆解、对比与优化:LLM工具智能体的五种任务规划与执行模式
文章探讨了大语言模型驱动的AI智能体的五种任务规划与执行模式,包括ReAct、Plan-and-Execute、静态Workflow、Workflow+局部智能、模块化的分层规划,分析其优缺点、适用场景,还给出优化方法。
CAIR开源发布超声基座大模型EchoCare“聆音”,10余项医学任务性能登顶
2025年9月17日,CAIR开源发布超声基座大模型EchoCare“聆音”。它基于超450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。
这样更公平:用jina-reranker-m0为多模态文档打分重排
文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。
管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱
Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入后门,且与模型规模及训练数据量无关。研究还测试了特定后门攻击,评估了多种训练配置。
从“造工具”到“用仓库”:RepoMaster,驾驭GitHub解决复杂任务的智能体大师!
RepoMaster旨在让AI智能体解决复杂开发任务。它能利用深度搜索定位GitHub仓库,其核心框架分三步闭环解决智能体‘看不懂、用不来’难题。实验显示它性能超主流框架,效率高,设计科学。
PaddleOCR 3.0发布:OCR精度跃升13%,支持多语种、手写体与高精度文档解析
2025年5月20日,飞桨团队发布并开源PaddleOCR 3.0,适配飞桨框架3.0正式版。其提升文字识别精度,支持多文字类型和手写体识别,满足复杂文档解析需求,结合文心大模型4.5 Turbo提升关键信息抽取精度,还新增国产硬件支持。
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务
手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。
Trae-Agent 刚刚开源,Windows-MCP 操作你的电脑,Chrome MCP 让AI自动化完成浏览器任务。
Trae - Agent 开源,可完成软件工程任务。Windows - MCP 能让 AI 操作 Windows 系统,Chrome MCP Server 使 Chrome 成 AI 助理。还介绍了 Gemini Cli、Claude 等工具及特点。
西湖大学修宇亮:数字人重建,慢慢都会变成基础模型的微调任务 | GAIR 2025
12月13日,西湖大学修宇亮在GAIR 2025分享数字人重建进展。其团队成果UP2You将建模时间从4小时缩至1.5分钟;ETCH获更准确内部人体结构;Human3R可实时动态重建人物场景。他认为未来数字人重建将成基础模型微调任务。
AI 产品范式探讨:非线性思维、多 Agent 协作才是复杂任务的更优解
本文探讨AI产品范式,指出当前大模型产品设计多将其视为‘万能单兵专家’,但复杂任务下效果不佳。提出群体智能、非线性思维等观点,阐述人机协作方向,介绍新范式及AI产品商业化核心是信任。