「可灵 API」共找到 4343 篇相关文章
阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!
在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。
微软发布5大AI Agent模式:一键解锁AI员工,打造智能体工厂
今天凌晨微软官网发布5种常用Agent模式助用户开发自动化AI员工。智能体比传统自动化工具更具优势,能推理协作等。各模式都有应用案例,且Azure AI Foundry支持多Agent模式开发。
开源TTS离线工具!浏览器本地运行,仅300MB模型大小,零服务器依赖,隐私0泄露!
传统TTS工具依赖云端,隐私风险高、延迟大且费用高。而Streaming-KokoroJS是基于Kokoro - 82M开发的开源TTS工具,能在浏览器本地运行,零服务器依赖,隐私零泄露,具备多项实用功能。
SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%
文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。
本周推荐的6个超级6的Github开源项目!
本文推荐6个Github开源项目,有能接入多平台的开源微信机器人CoW,基于VS Code魔改的AI代码编辑器Void,免费的ERP系统ERPNext,开源物联网平台ThingsBoard,共享虚拟浏览器Neko,微软轻量命令行编辑器Edit。
谷歌成立AI基金,为初创公司提供技术、资金
谷歌宣布推出AI Futures Fund,旨在投资运用DeepMind AI工具的初创企业,提供技术、资金支持,如提前接触模型、专家指导、云服务积分和直接投资等,未透露基金规模。
大模型评估排障指南 | 关于 LaTeX 公式解析
这是大模型评估排障指南系列第二篇,聚焦 LaTeX 公式解析。评估难点是解析和比较模型输出与标准答案,无标准方法。lm - evaluation 框架用 sympy 解析准确率约 0.94,还给出缓解问题办法。
从Chat、Code到Discovery,AI开始学着做科学家
本文报道AI发展进入全新阶段,任务从聊天、写代码拓展到自主科学发现,介绍PhAI Labs推出的DFM系统,分享架构设计与落地案例,分析行业痛点与解决路径。
WorkSwarm:引领办公智能体新范式,让AI从一个助手,进化为一支与你并肩作战的团队
办公智能体成热门赛道,openJiuwen推出WorkSwarm蜂群办公智能体,将多智能体协作引入个人办公场景。它有单Agent和集群两种模式,能自主组队、共享成果等,还支持多平台,openJiuwen社区也在招募开发者。
写给Agent的Loop,关键不在循环那六行代码本身
最近‘别再一句句给Agent写提示词,去写循环’说法火了。虽循环代码简单,但关键在模型周围。循环工程有四大难点,角色也从操纵Agent变为设计系统,不过此说法也有反对声。