输出质量」共找到 903 篇相关文章

开源动态8

腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实

腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。

AIGC开放社区
产品应用7

数智赋能:建筑地产行业的转型突围与未来筑造

建筑地产行业在全球经济中至关重要,当下数字化转型成关键。华为凭借对‘好产品’的理解及数字化实践,与多家企业合作推动转型。数智化在设计、运营等端发挥作用,助力行业实现效率与质量双飞跃。

机器之心
开源动态8

里程碑!逻辑智能发布全球首个完全开源语音大模型框架LLaSO,语音AI迎来新纪元

逻辑智能发布全球首个完全开源语音大模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强大基础模型。语音大模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。

AI科技评论
开源动态7

LangChain 推出开源异步编码智能体 Open SWE

LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。

InfoQ
开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线
产品应用8

一个APP就能拍短片!人物、字幕、BGM……AI Agent统统自己搞定

剪映旗下内容创作Agent小云雀上线新功能,可文生数字人,还能根据提示词生成视频。它有“参考图生视频”玩法,能解决图片混剪难题。依托字节模型,创作门槛低,交付质量高,限时免费。

量子位
开源动态7

香港科技大学、Manycor开源空间大模型,超3000颗星

香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。

AIGC开放社区
开源动态8

揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~

LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持多格式输出。在多行业有应用,性能提升显著,与同类项目相比优势明显。

小华同学ai
开源动态8

推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源

DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。

量子位
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位