多场景支持」共找到 5919 篇相关文章

开源动态8

JinaVDR: 一个图文混排文档搜索任务的基准集

现有文档检索基准大只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含语言、领域数据,可评估模型在复杂视觉文档的检索性能。

Jina AI
新闻资讯8

OpenAI发布MRC超算协议,重塑10万GPU集群通信,AMD等合作推进

OpenAI联合AMD等发布MRC超算协议,它基于RoCE标准,打破传统网络局限,解决超大规模计算集群难题,降低成本与能耗。MRC有平面网络等特性,已在超级计算机部署,规范也已公开。

AIGC开放社区
7

AI写爆款博客火出圈,主笔竟是Claude!

Anthropic为Claude开博客展示写作能力,内容经团队把关。AI写内容已不新鲜,但有翻车。普华永道研究称AI提升员工创效,重塑企业运营逻辑。公司推行AI战略,不过学生用AI作弊引担忧。

新智元
产品应用8

Claude Sonnet 4.5发布,领域性能超越GPT-5和Gemini 2.5 Pro

Anthropic发布Claude Sonnet 4.5,是目前最强编程模型,在领域性能超GPT - 5和Gemini 2.5 Pro。操作电脑、数学推理能力提升,产品更新功能丰富,安全性增强,价格不变,获家公司认可。

AI工程化
产品应用8

阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!

阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。

开源星探
开源动态8

数字人视频革命!MultiTalk开源:15秒人对话一键生成,歌唱/卡通全驾驭!

在AI驱动的视频生成领域,创建人对话场景是难题。MultiTalk是开源音频驱动人对话视频生成框架,由MeiGen - AI等联合研发,输入路音频等就能生成嘴型同步的视频,适用于场景

开源星探
开源动态8

AI教母李飞飞空间智能开源大动作:上亿节点3D高斯场景塞进手机网页

AI教母李飞飞的空间智能公司World Labs开源3D高斯泼溅网络渲染器Spark 2.0,打破硬件与平台壁垒,将亿级渲染能力带到网页和移动端,解决Web端痛点,还采用三大核心技术系统及更黑科技。

AI寒武纪
推荐文章7

AI 产品范式探讨:非线性思维、 Agent 协作才是复杂任务的更优解

本文探讨AI产品范式,指出当前大模型产品设计将其视为‘万能单兵专家’,但复杂任务下效果不佳。提出群体智能、非线性思维等观点,阐述人机协作方向,介绍新范式及AI产品商业化核心是信任。

Founder Park
开源动态8

红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用

红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。

Founder Park
新闻资讯7

刚刚,国产GPU赛道又跑出一个 2700 亿估值独角兽!“中国AMD”沐曦股份完成 IPO,开盘大涨超 500%

2025年12月沐曦登陆科创板,股价达679元/股,估值破2700亿。其定位全栈GPU提供商,产品覆盖领域。2022 - 2024年营收三年复合增长率超4000%,但累计净亏损超30亿。核心团队来自AMD。

InfoQ