C2LLM」共找到 2914 篇相关文章

算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。

量子位
开源动态7

Karpathy组建大模型「议会」,GPT-5.1、Gemini 3 Pro等化身最强智囊团

前OpenAI联合创始人Andrej Karpathy发推称养成用LLM阅读习惯,还做了个新项目,让四个最新大模型组成LLM议会当智囊团。项目是Web应用,提问后多模型处理,有互评和投票机制,已开源。

机器之心
开源动态8

国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~

国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。

PaperAgent
产品应用8

Claude Sonnet 4.5发布,多领域性能超越GPT-5和Gemini 2.5 Pro

Anthropic发布Claude Sonnet 4.5,是目前最强编程模型,在多领域性能超GPT - 5和Gemini 2.5 Pro。操作电脑、数学推理能力提升,产品更新功能丰富,安全性增强,价格不变,获多家公司认可。

AI工程化
算法论文8

一夜200万阅读,OpenAI神同步!这项测评框架让全球顶尖LLM全翻车

中国团队领衔全球24所高校机构发布评测LLMs for Science能力的论文,一夜阅读近200万,同一时间OpenAI也发文指出现有评测标准在AI for Science领域失灵。论文推出评测体系SDE,发现主流大模型在科学发现上短板明显。

新智元
开源动态7

Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!

全球最快开源大模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。

量子位
产品应用8

基于浏览器请求录制与AI代码生成的E2E接口自动化测试实践

文章以阿里云DataWorks为例,介绍通过浏览器录制插件捕获请求数据,结合AI编程工具生成接口封装与测试用例,解决复杂平台自动化测试难题,对比传统与新范式,剖析新范式优势、协作机制等。

阿里云开发者
新闻资讯8

英伟达自毁CUDA门槛!15行Python写GPU内核,性能匹敌200行C++

英伟达发布CUDA 13.1,称是自2006年诞生以来最大进步。推出CUDA Tile编程模型,能用15行Python代码实现200行CUDA C++代码性能。芯片界传奇Jim Keller质疑其会终结CUDA“护城河”。

量子位
产品应用8

刷榜风波惊动OpenAI后,这家中国团队拿回Agent硬核榜单第一

在OpenAI主导的MLE - Bench基准测试上,百度伐谋2.0击败对手登顶。此前有团队刷榜引发风波,官方新增清洁赛道。伐谋2.0在多方面优化,还在汽车、金融、科研等产业落地解决难题。

机器之心
开源动态8

刚刚!Meta把大模型塞进脑机接口,隔空读脑直逼开颅植入水平,代码全开源

Meta推出Brain2Qwerty v2,号称性能最强端到端方案,能基于非侵入式脑部记录实现实时句子级解码,准确率逼近开颅手术水平。还开源代码,公开数据集,旨在帮脑损伤患者交流。

AI寒武纪