生物医学基准测试」共找到 2062 篇相关文章

新闻资讯8

The Batch: 885 | Claude 升级了

Anthropic更新中型模型Claude Sonnet至4.5版本,在性能上显著提升,还引入可变推理token预算。Claude Code智能编码工具也获功能增强,新增Claude Agent SDK等。测试中Claude Sonnet 4.5表现优异,Anthropic重心转向编码与职场生产力。

DeeplearningAI
算法论文8

LLM驱动的威胁情报提取框架,从非结构化到STIX的自动化:IntelEX

为应对网络攻击,需将非结构化网络威胁情报转化为结构化情报。IntelEX是自动化攻击级威胁情报提取工具,通过LLM上下文学习等增强,能识别攻击序列并提取结构化情报为STIX格式,还可转化成Sigma,在测试中表现优异。

AI与安全
开源动态8

加速量子计算到来!英伟达开源模型拉爆量子计算股

英伟达发布并开源全球首个加速量子计算应用的模型系列Ising,打破硬件校准和纠错耗时难题,提供比传统方法更快、更准的量子纠错解码能力,还推出校准基准测试,全方位开源吸引众多机构加入。

AIGC开放社区
产品应用7

刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?

DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。

新智元
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
算法论文8

75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划

哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。

PaperAgent
产品应用8

从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知

智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。

花叔
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。

带你学AI
7

OpenAI 广告续命遭全网骂,用户要跑路Gemini!需烧 400 亿,18个月破产预警

OpenAI计划在ChatGPT对话界面向美区免费版和低价订阅用户测试广告投放,旨在拓展营收缓解成本压力。此举动引发批评,用户转向Gemini。OpenAI虽营收增长,但算力投入大,首席财务官称加广告会坚守三大原则。不过,有预测称其18个月内或破产。

AI前线
开源动态8

纯血国产!4B模型越级打怪,杀入万亿赛道

9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。

新智元