图论难题」共找到 417 篇相关文章

新闻资讯7

DeepSeek、GPT、Qwen,所有大模型架构都有,Karpathy:宝藏画廊!

大模型赛道热闹,架构创新多,理解困难且缺清晰架构。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线谱「LLM Architecture Gallery」,方便研究者查阅对比。

机器之心
算法论文8

科研数据不再碎片化!一张可计算,连起整个科研世界

UIUC研究团队打造ResearchArcade,将ArXiv论文、OpenReview评审等碎片数据连接成动态知识谱。它有多源、多模态等特征,支持多种格式数据导入导出,定义了六个任务,验证了结构在科研数据处理中的作用。

新智元
算法论文8

Depth Anything再出新作!浙大&港大出品:零样本,优化任意深度

浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,零样本刷新多项深度处理纪录。

新智元
算法论文7

多模态模型挑战北京杭州地铁!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
开源动态8

Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看翻译!

Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看翻译,亮点颇多。

开源星探
新闻资讯7

独家|美入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
开源动态8

AI 出为什么总很土?2100 星开源 Skill 用 244 行给了答案

AI出常显土气,开源项目`gc - minimal - zine - poster`用244行文档给出答案。它将日系zine感拆分为可执行指令,规定九个渲染问,还给出取值区间和自检方法,能防止风格自我复制,且适配多种Agent。

AI Reading Hub
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出快且便宜。二者串联使用,像生成与视频创作可无缝衔接。

量子位
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔
算法论文8

AI看一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位