GPT - 4.1」共找到 3442 篇相关文章

算法论文8

谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分

纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。

机器之心
开源动态7

MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制

本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。

AI大模型应用实践
产品应用7

1篇长文 = N张小红书爆款图?!Gemini 2.5 Pro 这效率,我跪了!

作者作为小红书小号主,苦于长文转图难,用Gemini 2.5 Pro Preview 05 - 06实现了一键转换。文章分享提示词结构、使用方法、修改方式,还介绍用AI调风格,指出系统有生成不稳定和下载问题。

AI产品黄叔
开源动态8

1.9K Star!给 DeepSeek Harness 装上侧边工作台,文件、终端、Git、浏览器、插件一屏搞定!

DeepSeek Harness 是 AI Agent 运行框架,自由度高但默认 Web UI 操作不便。社区插件 DSH - better - sidebar 迅速出圈,装了侧边工作台,整合多样工具,更新勤,适合折腾 DSH 的人。

开源星探
开源动态8

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。

机器之心
新闻资讯7

3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产

最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试表现出色,不过在通用知识领域表现欠佳。

机器之心
算法论文8

7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”

上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。

量子位
新闻资讯8

4.3亿听障人士的福音,哥大团队研发脑控助听器,最高增益12分贝

哥伦比亚大学等机构团队研发实时闭环脑控听力系统,发表于Nature Neuroscience。该系统解码大脑注意力信号,放大目标人声、压制杂音,打破传统助听器瓶颈。经多项测试,效果显著,临床应用潜力大。

DeepTech深科技
新闻资讯8

1美元买10颗星?顶会曝出GitHub假星灰产,热门仓库或藏木马

ICSE顶会论文曝出GitHub上600万颗星可能是刷出来的,大量“热门项目”或为恶意软件仓库。研究团队来自多所高校和公司,公开了检测方法和源码。刷星短期有用,长期是负资产,还可能藏木马,研究团队给出治理建议。

新智元
开源动态8

GitHub 上 6.4 万标星的 Hermes Agent,比 OpenClaw 响应快太多!还会成长进化!

AI Agent领域热闹,OpenClaw有响应慢等问题。Nous Research今年2月开源的Hermes Agent爆火,获64.8K Star。它是自学习型AI智能体,有六大核心特性,支持换模型,更新快,还支持一键安装。

开源星探