代码能力评测」共找到 4873 篇相关文章

推荐文章8

为什么 2025 的基模公司都押注 Interleaved Thinking?

本文探讨 2025 年基模公司押注 Interleaved Thinking 的原因。从大模型迭代说起,介绍其在多模型中的体现,阐述该思维链对 Agent 的重要性,还提及 MiniMax 在推动其成行业标准上的诸多努力及带来的影响。

MacTalk
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
算法论文7

两招为GraphRAG图谱“提纯”,DEG-RAG效果有点炸~

文章指出传统RAG多跳推理和全局一致性能力受限,Graph - based RAG虽好但图谱噪音大。作者提出Deg - Rag方案,含实体消歧和关系反思两招。实验显示去噪后图谱效果提升,验证“Less is More”理念。

PaperAgent
新闻资讯7

AI PC,一场关于算力、场景与生态的远征

AI PC 市场竞争升温、格局重塑,本质是下一代计算入口争夺。英特尔通过硬件创新、生态共建等推动 AI PC 发展,在 2025 抖音商城秋上新秀展出相关产品,其酷睿 Ultra 处理器优势明显,市场呈多元竞逐态势。

AI科技评论
新闻资讯8

浙江大学联合华为发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础大模型

2025年9月18日,浙江大学任奎教授团队联合华为在“华为全联接大会2025”发布国内首个基于昇腾千卡算力平台的DeepSeek - R1 - Safe基础大模型,提升了我国AI系统自主安全防控水平,任奎获“科研创新卓越贡献奖”。

AI大模型应用实践
开源动态8

腾讯开源了一个通用智能体,又刷榜了GAIA~

腾讯优图实验室开源了 `Youtu-agent`,在深度搜索和工具使用benchmark上表现佳。它不依赖GPT/Claude,有自动智能体生成功能,提供单、多智能体模式,还集成分析平台,可实时调试与离线分析。

探索AGI
新闻资讯7

一觉醒来,GitHub没了?CEO辞职,微软接管,开发者天塌了

GitHub CEO Thomas Dohmke宣布辞职,GitHub将不再独立运营,整体并入微软新成立的CoreAI工程集团。微软不再为其找新CEO,由多位微软高管分管。GitHub将成微软AI时代‘武器库’。

新智元
新闻资讯7

GPT-5 最强大的,是编程

据报道,OpenAI的GPT - 5即将到来且早期反馈积极。它在编程领域表现突出,尤其在实际编程任务上有提升,不过其具体形式存疑,改进或多来自后训练阶段的强化学习。

AGI Hunt
算法论文8

用MoE打造DNA基础模型更强范式!人大实现seq2func全新突破

中国人民大学团队提出SPACE模型,通过引入物种感知编码器和谱系分组增强解码器,革新架构,提升了DNA基础模型性能与泛化能力,在多项测试中表现优于主流模型。

新智元
开源动态8

用视频存储文本的黑科技!

memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。

GitHubStore