「F2LLM」共找到 2796 篇相关文章
Clawdbot再次更名:新名OpenClaw,官宣支持Kimi K2.5和小米MiMo
两个月前Peter Steinberger搭建的项目,最初叫WhatsApp Relay,现获超10万GitHub星标、单周200万访问者。1月29日正式更名为OpenClaw,它是开源AI助手平台,此次发布新渠道、支持新模型等。
2025全球前2%顶尖科学家榜单发布!清华国内第一、Bengio全球前十
当地时间9月19日,斯坦福大学和爱思唯尔发布2025全球前2%顶尖科学家榜单。清华746位学者入选,全球大学排第四超斯坦福。周志华、张正友进全球前1000,图灵奖得主Bengio进年度前十。
性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令
现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。
Karpathy组建大模型「议会」,GPT-5.1、Gemini 3 Pro等化身最强智囊团
前OpenAI联合创始人Andrej Karpathy发推称养成用LLM阅读习惯,还做了个新项目,让四个最新大模型组成LLM议会当智囊团。项目是Web应用,提问后多模型处理,有互评和投票机制,已开源。
国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~
国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。
Claude Sonnet 4.5发布,多领域性能超越GPT-5和Gemini 2.5 Pro
Anthropic发布Claude Sonnet 4.5,是目前最强编程模型,在多领域性能超GPT - 5和Gemini 2.5 Pro。操作电脑、数学推理能力提升,产品更新功能丰富,安全性增强,价格不变,获多家公司认可。
一夜200万阅读,OpenAI神同步!这项测评框架让全球顶尖LLM全翻车
中国团队领衔全球24所高校机构发布评测LLMs for Science能力的论文,一夜阅读近200万,同一时间OpenAI也发文指出现有评测标准在AI for Science领域失灵。论文推出评测体系SDE,发现主流大模型在科学发现上短板明显。
Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!
全球最快开源大模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。
基于浏览器请求录制与AI代码生成的E2E接口自动化测试实践
文章以阿里云DataWorks为例,介绍通过浏览器录制插件捕获请求数据,结合AI编程工具生成接口封装与测试用例,解决复杂平台自动化测试难题,对比传统与新范式,剖析新范式优势、协作机制等。
刷榜风波惊动OpenAI后,这家中国团队拿回Agent硬核榜单第一
在OpenAI主导的MLE - Bench基准测试上,百度伐谋2.0击败对手登顶。此前有团队刷榜引发风波,官方新增清洁赛道。伐谋2.0在多方面优化,还在汽车、金融、科研等产业落地解决难题。