「多模型支持」共找到 9878 篇相关文章
清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发
大语言模型存在“知识截止”问题,RAG技术应运而生,成为大模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。
Agent接管EDA工作流,不只写脚本!浙大打通真实芯片设计闭环
大模型正以Agent形态进入真实EDA工具链。浙大卓成团队构建OpenClaw + FluxEDA联合架构,打通关键链路,解决模型操作真实EDA工具的难题,在多任务中完成连续分析与优化闭环,推动EDA工作流范式转变。
从技术狂欢到企业落地,智能编程的全球破局战
智能编程是AI应用增长快的赛道,正从代码补全迈向AI自主开发。国内模型能力提升,阿里Qwen3 - Coder超越部分闭源模型。阿里云通过多策略破局,其产品助力企业落地,但仍面临适配、安全等挑战。
Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!
语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。
MultiAgent架构实践:如何打造GitHub Stars 2.8k的ComfyUI-Copilot V2.0
ComfyUI是Stable Diffusion生态中可视化编程工具,但使用有难度。ComfyUI - Copilot V2.0基于多智能体协作框架构建,能实现对话开发、报错修复等功能,还介绍了其架构、技术栈及多智能体设计思路等。
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。
文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL
MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试。
腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合
日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。
蚂蚁百灵新一代Ling-3.0开源,智效比13.2,124B释放1T能力
蚂蚁百灵新一代模型Ling-3.0开源,有flash和tiny两版本。Ling-3.0-flash参数量124B,智效比13.2,输出快成本低;Ling-3.0-tiny参数量7.9B,激活少且适用多场景,二者都极致挖掘模型效率。
当前关于 Vibe Engineering 的所有认知都会在 1 个月内严重过时
作者分享 Vibe Engineering 实践体会,指出当前认知很快过时,因 AI 编程工具和模型进步大。还对比了 Opus 4.5、GPT - 5.2 等模型,阐述人在开发各阶段角色,介绍多 Agent 协同实践及未来软件公司组织形态变化。