深度学习研究」共找到 3486 篇相关文章

推荐文章7

Learn to Reason _ The way of Baichuan-M1-ClinicReasoning

前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。

InfoQ
开源动态8

大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心
新闻资讯7

加一个字母就可以绕过AI围栏,新的漏洞:TokenBreak

提示词注入攻击威胁大模型及应用,当前主要防护方法是用BERT模型检测。HiddenLayer团队发现TokenBreak漏洞,通过加字母绕过检测。研究表明BPE和WordPiece分词策略易受攻击,Unigram不易,建议优先选Unigram类模型。

AI与安全
推荐文章8

2025年多款Deep Research智能体框架全面对比

文章从 OpenAI 关于 DeepResearch 的指南入手,对多个开源深度研究智能体框架进行架构解构与功能对比,还体验了商业化智能体应用,为使用者和开发者选工具框架提供参考。

腾讯技术工程
7

AI写爆款博客火出圈,主笔竟是Claude!

Anthropic为Claude开博客展示写作能力,内容经团队把关。AI写内容已不新鲜,但多有翻车。普华永道研究称AI提升员工创效,重塑企业运营逻辑。多公司推行AI战略,不过学生用AI作弊引担忧。

新智元
算法论文8

统一架构新思考,北大团队UniWorld-V1统一大模型

北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究

AI寒武纪
算法论文8

DeepMind:Transformer存在拓扑缺陷,思维链治标不治本

谷歌DeepMind论文指出,Transformer架构不擅长追踪状态,思维链只是给结构性缺陷打补丁,成本高。论文主张用循环架构替代或补充纯前馈结构,还提出多个研究方向,认为下一代模型需构建‘流动的现实表示’。

机器之心
新闻资讯7

陶哲轩:用了GPT-5 Pro后,小尺度、宏观尺度很赞,中尺度有点垮

著名数学家陶哲轩用ChatGPT - 5 Pro研究曲率有界的球面问题,记录AI在不同层面的表现。小尺度和宏观尺度AI有用,中尺度帮助有限。虽问题未解决,但他学到新知识,也意识到与AI协作要谨慎。

机器之心
新闻资讯8

DeepSeek 跃居全球第二 AI 实验室,中美正式并驾齐驱!

Artificial Analysis宣称DeepSeek R1跃居全球第二,其0528版得分达68分,与Google Gemini 2.5 Pro并列。更新体现强化学习的重要性,多家云服务提供商也迅速支持新模型,这表明开源与闭源模型差距缩小,中美AI并驾齐驱。

AGI Hunt
算法论文8

ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境

北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。

机器之心