「生成式方法」共找到 2705 篇相关文章
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
如何“驯服”你的Agent?这可能是你见过最优雅与可控的Agent框架 | 深度体验
文章聚焦对话式Agent,指出LLM不确定性是企业应用Agent的障碍。介绍Parlant框架,它用ABM方法控制交互,能降低LLM负担、处理边缘场景。还通过构建10086客服助手展示其使用,最后与LangGraph对比。
大模型幻觉检测新方法:实时高亮不确定内容
来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。
扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍
Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。
“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式
Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。
中国科大Science-Star(科星) : 一体化、可扩展的科学智能体搭建平台
中科大认知智能全国重点实验室开发了 Science - Star 科研智能体平台。它基于 ReAct 引擎,有一体化可视化支持、插拔式模块化架构和跨学科工具集成等特色,为科研智能体研发与实验提供高效基础设施。
打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%
基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。
当代码遇上大模型:智能编程助手的架构设计与工程实践
在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。
一个APP就能拍短片!人物、字幕、BGM……AI Agent统统自己搞定
剪映旗下内容创作Agent小云雀上线新功能,可文生数字人,还能根据提示词生成视频。它有“参考图生视频”玩法,能解决图片混剪难题。依托字节模型,创作门槛低,交付质量高,限时免费。