「多粒度理解」共找到 4694 篇相关文章
两周干成一天!毕马威用100页Prompt落地企业Agent
毕马威打造税务AI助手TaxBot,将两周的专业咨询工作缩至一天,效率提升超10倍。其构建KPMG Workbench平台,集成多模型,用100页Prompt指导学习,未来或采用Agent Runtime服务。
港大nanobot4,000行代码复刻Clawdbot
港大nanobot用4000行代码复刻Clawdbot,解决AI从‘被动回答’到‘主动服务’问题。它有核心架构Agent Loop,三大主动触发机制,模块化设计,还坚持少即是多原则,让AI成自动化助手。
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清
来自多机构的研究团队发布“可实践的机制可解释性”综述,通过 'Locate, Steer, and Improve' 三阶段范式,为大模型的对齐、能力增强和效率提升提供方法论,还梳理可解释对象体系和干预手段。
上海人工智能实验室让AI像科学家一样在探索中发明工具
上海人工智能实验室等团队提出推理时工具演化(TTE)框架,推动AI在科学领域从被动选工具到主动发明工具。它解决传统工具库问题,提升多学科推理准确率,赋予AI跨学科迁移能力。
当人形机器人还在画饼,这家公司已用“带大脑的机械臂”实现批量落地 | 甲子光年
当资本热捧人形机器人时,微亿智造已率先将工业具身智能规模化落地。其‘创TRON’机器人解决多行业痛点,实现降本增效,落地版图不断扩大,还构建技术护城河,未来将迈向群体智能。
Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!
Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。
告别黑箱解释!首个潜变量自动解释框架 | CIKM'25
深度生成模型内部运作如「黑箱」,潜变量意义难捉摸。埃默里大学团队提出LatentExplainer框架,经数据扰动、智能提示、不确定性评估三步,为潜变量生成易懂解释,提升模型解释质量与可靠性。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!
随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。