基于图谱而非运气:GxP-Agent如何让临床数据LLM编程变得可靠

25 八月 202616 视图

我们正在审查一个预印本,其中五个先进的LLMs没有为提交规章编制有效的分析数据集,而基于15个专门节点的定向循环图的多剂系统实现了100%的结构与参考一致。 这种方法将单字代码生成转换为可核查域特定步骤的序列.

基于图谱而非运气:GxP-Agent如何让临床数据LLM编程变得可靠

临床编程: LLMS 跌倒之处

编制临床试验数据以供提交规章,是一个有严格要求的过程。 协议需要转化为符合CDIC标准的分析数据集,这里的任何错误都可能花费延迟或拒绝应用的代价. 在很长一段时间里,这个阶段仍然是一个瓶颈:它既需要域知识,又需要精确的代码,以及对监管逻辑的理解.

在使用大型语言模型生成这样的代码时,画面看起来很暗淡. 在arXiv上的预印上描述的一个实验中,五个前沿模型获得了11个创建有效主题级数据集的单镜头尝试——没有一个成功. 这不是小缺点,但 关于结果完全无法使用的问题。 这些模型似乎忽略了过程的结构:它们试图一次组装整个管道,而不进行中间检查,也不了解哪些步骤是强制性的,哪些步骤取决于以前的步骤。

GxP 代理: 通过进程图分解

这个问题的答案是多代理系统GxP-代理. 它的关键想法是不要依赖模型的"合理性"来解释监管过程是如何运作的,但是. 明确编码此进程。 管制行动顺序作为定向循环图(DAG)来表示。 任务不是一步中整个数据集的单一生成,而是细分为15个域特定节点. 每个节点都是由配备有来自药典的技能背景的工人代理人单独进行的操作. 节点之间设有验证门,必要时提供有条件的复试.

这种办法改变了错误的性质。 如果模型在一些节点偏离了预期结果,则会立即被检测到,步骤可以重启,而不是重做整个管道. 实质上,LLM不再成为"一时万物的产生者",成为本地,详解的子任务的执行者. 图表地形学提供了一个僵硬的框架,在这个框架内,模型可以更自由地行动.

这在实际上是什么样子

每个DAG节点负责一个特定的数据域,工人接收的不是"构建ADSL"这样的抽象任务,而是带有明确输入,输出,验证标准的狭义任务. 如果结果未能验证,则启动有条件的重试——代理接收反馈并纠正代码. 这类似于一个"基因——检查——修复"循环,但嵌入在图表结构中而不是任意执行.

CDSC- Bench上的数字:从0到100

为了评价这一方法的有效性,作者们制定了一个基于执行的基准,称为CDIC-Bench. 它以林业发展局实际提交的试点报告——CDISCPilot01为基础,其中包括254个课题和49个地面实况ADSL变量。 这样的基准不仅检查代码的语法或语义,而且检查其执行的实际结果.

在此,GxP-Agent显示出令人印象深刻的结果:用克劳德·索内4.6模型,它实现了100%的结构匹配——所有49个变量和所有254个记录在3个独立运行中都是正确的. 相比之下,最佳回收强化基线停止在59.2%,所有其他办法——单一代理和扁平多代理——都得零分。 换句话说,没有图表的建筑结构 根本无法处理 任务。

疲劳模式也有好处

一个有趣的副作用:DAG地形降低了模型本身的要求. 当GPT-4.1在同一图上作为工人使用时,平均结构匹配率为59.2%——与强模型上的检索增强基线水平相同. 没有图表结构,GPT-4.1显示出零结果. 这证实,发挥决定性作用的不是单个模式的力量,而是如何组织这一进程。

方针和结论的敏感性

提交人并不局限于一个领域。 同样的原理也适用于ADAE数据集(逆向事件)——它使用由9个节点,55个变量和1191个记录组成的分支DAG. 在第一次尝试中实现了100%的结构匹配. 这表明该方法概括到ADSL以外,适合其他类型的临床数据.

作品的主要取材: 临床编程中的可靠性不是通过LLMs的"智能推理"来实现的,而是通过以图表地形学形式对过程的编码域知识实现的. 这一模式仍然是该系统的一个重要但并非唯一的组成部分。 是图设定了约束和顺序,而语言模型则以混凝土代码填充. 这种共生性使得有可能获得在提交管制材料时可以依赖的符合GxP的结果。

常问问题

GxP 代理服务器 图表如何使 LLM 编程可靠