「GPT-4.1」共找到 3459 篇相关文章
0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了
SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。
3.3k星星爆火!Claude Design开源升级版,中文本地化,支持DeepSeek V4
Anthropic发布的Claude Design能生成UI、人机协作,但国内无法使用且不能用自己的API。Open-codesign是其开源本地化平替方案,支持多模型,功能丰富,保密性好。
谷歌Deep Think八语奥赛屠榜!自主攻克4大未解难题,科研壁垒崩塌
谷歌Deep Think横扫亚欧多语种竞赛,成绩亮眼。虽评测数据来自内部,未公开细节且是区域赛,但它定位为‘人类智力倍增器’,其驱动的Aletheia已产出论文,解决4个未解问题,在多领域展现潜力。
开源两天斩获 1.8K Star!把网站变成命令行工具,支持国内外主流平台!
OpenCLI是开源的AI原生命令行工具,能把网站或Electron应用变命令行接口,复用Chrome登录状态,安全性高。支持19个主流平台,有自修复配置等亮点,还介绍了安装、使用、诊断及下载方法。
CVPR 2026 | 从视觉Token内在变化量出发,实现VLM无损加速1.87倍
随着高分辨率图像与长视频处理需求增长,大型视觉语言模型推理效率成瓶颈。V²Drop从视觉Token内在变化量出发,采用多阶段渐进式剪枝策略,实现无损加速,在图像和视频理解场景表现卓越。
99%的人只发挥出了龙虾的1%的能力:龙虾邪修养法
博主Alex Finn分享让OpenClaw效能提升100倍的核心方法论,即构建专属任务控制中心。介绍了任务看板、日历面板等核心工具模块,还指出不要盲目抄袭,要用反向提示词定制工具面板。
首家央企AI独角兽浮出水面!背靠自研大模型,4家国家队资本背书
中电信人工智能科技(北京)有限公司成为央企首家AI独角兽,完成首轮增资,引入四家国家级战略投资方。其靠自研“星辰”系列大模型,在多领域突破,实现技术与市场认可闭环,有望推动AI产业落地。
AI4S回归白盒符号主义,清华等联合发布SR-LLM:自主发现科学知识
清华大学等多所高校联合发布SR - LLM,这是融合大语言模型与深度强化学习的符号回归框架。它从数据生成可解释数学模型,在跟车行为建模等任务表现优,为机器自主科学发现开辟新路径。
谷歌重回铁王座!Gemini 3吊打GPT-5,奥特曼发信承认技不如人
谷歌携Gemini 3和Nano Banana Pro强势回归AI王座,连奥特曼都承认谷歌「反超」。谷歌逆袭原因多样,创始人布林回归打破「大公司病」,CEO劈柴推动「AI优先」,还有自研TPU提供算力保障。
中国医生需要怎样的AI?GPT-5、OpenEvidence都输掉实战后,我们有了答案
国家卫健委定调医疗AI未来五年核心目标为「人工智能+基层应用」,但基层医疗AI应用现状不佳。临床专家认为能帮基层的AI要安全有效、人机协同,「未来医生AI工作室」符合这些要点,其基座MedGPT表现出色。