AbstraktBaggrund Målet med den kunstige intelligens iNyre ardannelse(AIRS) undersøgelse er at udvikle maskinlæringsværktøjer til ikke-invasiv kvantificering afnyrefibrosefra billedscanninger. Metoder Vi udførte en retrospektiv analyse af patienter, der havde en eller flere abdominal computertomografi (CT) scanninger inden for 6 måneder efter ennyrebiopsi. Den endelige kohorte omfattede 152 CT-scanninger fra 92 patienter, som omfattede billeder af 300 indfødte nyrer og 76transplantere nyrer. To forskellige foldningerneurale netværk(klassifikatorer på skiveniveau og voxelniveau) blev testet for at skelne mellem svær og mild/moderatnyrefibrose($50% versus,50%).Interstitiel fibroseog tubulær atrofi scorer franyrebiopsirapporter blev brugt som sandhed. Resultater De to maskinlæringsmodeller viste lignende positiv forudsigelsesværdi ({{0}}.886 versus 0.935) og nøjagtighed (0.831 versus 0,879). Konklusioner Sammenfattende er maskinlæringsalgoritmer et lovende ikke-invasivt diagnostisk værktøj tilkvantificere nyrefibrosefra CT-scanninger. Den kliniske anvendelighed af disse forudsigelsesværktøjer med hensyn til at undgå nyrebiopsi og associerede blødningsrisici hos patienter med svær fibrose, mangler at blive valideret i prospektive kliniske forsøg.

HVOR LANG TAGE DET FOR CISTANCHE AT ARBEJDE FOR NYREPATIENTER?
Introduktion
Ultralydsvejledt perkutan nyrebiopsi forbliver standarden for behandling, når den histologiske diagnose er nødvendig for at vejlede håndteringen af proteinuri, mikroskopisk hæmaturi, transplantatafstødning eller uforklaret nyredysfunktion (1,2). Graden af nyrefibrose eller sværhedsgraden af CKD er ofte ukendt på tidspunktet for nyrebiopsi (3). En nyrebiopsi, der afslører alvorlig (0,50%) fibrose kan afklare sygdomsdiagnosen, men vil sandsynligvis ikke ændre den kliniske behandling og placere patienter i risiko for procedurerelateret blødning (4). Post-biopsi-komplikationer spænder fra forbigående hæmaturi til livstruende blødning og korrelerer med risikofaktorer, der omfatter forhøjet blodtryk, fremskreden alder, anæmi, lavt antal blodplader, nedsat nyrefunktion og hæmostaseabnormiteter (5). En nylig metaanalyse af 118,064 ultralyds-guidede nyrebiopsier rapporterede hændelser for blodtransfusioner, angiografisk intervention og død på henholdsvis 2 %, 0,3 % og 0,06 % (6).

Vurdering af sværhedsgraden af CKD er kritisk, når man overvejer risici og fordele ved en nyrebiopsi, men ikke-invasive værktøjer til at evaluere graden af fibrose er underudviklede (7). Undersøgelser, der udforskede ultralydsteknikker (herunder billeddannelse af forskydningsbølgehastighed, transient elastografi, realtidselastografi, Doppler-sonografi og ultralyds corticomedullær stamme) har bemærket inkonsekvent korrelation med graden af fibrose på nyrehistologi (3,8,9). Desuden er disse metoder stærkt afhængige af eksterne faktorer, såsom blodtryk, nyrevægt, kropsvægt og den påførte transducerkraft, for ikke at nævne høj intra- og interobservatørvariabilitet (3). En nylig rapport fandt en tæt sammenhæng mellemultralydsbestemt nyrestørrelse med estimeret nyrefunktion (eGFR), men ikke vurderetnyrefibrose(10). Kirpalani et al. rapporterede, at magnetisk resonansbilleddannelse elastografi var lovende med hensyn til at korrelere stivhedsscore med nyrefibrose (11), men udforskede ikke maskinlæringsværktøjer som et middel til at optimere prædiktiv nøjagtighed.
Computertomografi (CT) muliggør billeddannelse af nyrevæv i høj opløsning med minimal strålingseksponering for patienten (7). Maskinlæringsteknologi i kombinationtion med CT-billeddannelse er en lovende vej for de ikkeinvasiv vurdering af nyrefibrosis, i stedet for strømmenhistologisk plejestandard. Deep learning konvolutionerendeneurale netværk (CNN) er en ny form for maskinlæringing, der kan isolere relevante mønstre fra hanstologi, billeddannelse eller andre kliniske data, der er nyttige for sygdom
karakterisering (12,13). CNN-teknologi til diagnostik er blevet udforsket i en række forskellige omgivelser, lige fra intrakraniel blødning og kræft til lungebetændelse ogblindtarmsbetændelse (14-17).
Målet med Artificial Intelligence in Renal Scarring (AIRS) undersøgelsen er at udvikle CNN-værktøjer til at kvantificere nyrefibrose som et computerstøttet diagnostisk alternativ til nyrebiopsi. To CNN-algoritmer (slice-niveau og voxel-niveau klassifikatorer) blev trænet til at analysere CT-billeddannelse af indfødte og transplanterede nyrer for at klassificere graden af fibrose, baseret på grundsandhed fibrose-score fra nyrebiopsier hos de samme patienter. I denne pilotanalyse fokuserede vi på at afgrænse mild/moderat versus svær (50% versus $50%) fibrose som en klinisk relevant dikotomi, der kan være nyttig for en nefrolog, der overvejer nyrebiopsi til deres patient. Vi demonstrerer, at CNN-algoritmerne kan skelne alvorlig fra mild/moderat nyrefibrose med en høj grad af nøjagtighed
Materialer og metoder
Patientdatabase Dette var en retrospektiv analyse af nyrebiopsier udført ved University of California Irvine Medical Center mellem 2014 og 2019. Vi identificerede patienter med $1 abdominal CT-scanninger gennemført inden for 6 måneder efter nyrebiopsien. Efter den indledende screening af journalsystemet blev 42 patienter, der gennemgik billeddiagnostik, ekskluderet af følgende årsager: CT-scanning udført uden for inklusionsperioden (0,6 måneder fra biopsidato, n53); abdominal magnetisk resonansbilleddannelse, men ingen CT fundet i systemet (n56); patienter, der uforvarende blev sprunget over i annotationsprocessen (n52); indfødte nyrer, der ikke er segmenteret hos en patient, der havde gennemgået en transplantation (n51); lavkvalitetsscanning med hardwareartefakt (n51); og eksterne billeddannelsesundersøgelser, der ikke blev gemt i de langsigtede billedbehandlingsarkiver (n529). De resterende 152 CT-scanninger fra 92 patienter blev downloadet, og det aksiale bløddelsrekonstruerede volumen blev ekstraheret til yderligere analyse. Størstedelen af CT-scanningerne (79%) blev udført uden intravenøs kontrast; 129 scanninger blev udført på en Philips-scanner, 22 på en Siemens-scanner og én på en GE Medical Systems-scanner.
En patolog (JEZ) gennemgik et tilfældigt udvalg af patienter for at bekræfte, at graden af fibrose var nøjagtigt dokumenteret i nyrebiopsirapporter. Hos uenige patienter gennemgik en anden patolog objektglassene for at fastslå sandheden (se Anerkendelser). Ground-truth grad af nyrefibrose fra biopsirapporter blev behandlet som et binært resultat: mild/moderat versus svær (interstitiel fibrose og tubulær atrofi, 50% versus $50%). Native nyrer i CT-scanninger fra patienter, der blev transplanteret, blev automatisk bedømt som alvorlig fibrose. Demografi og komorbide tilstande blev kompileret i en REDCap-database, og CT-billeder blev tilgået som beskrevet nedenfor. Alle forskningsprocedurer blev godkendt af University of California Irvine Institutional Review Board.

Anmærkning
CT-scanningerne blev overført fra vores hospitals billedarkiverings- og kommunikationssystem til en sikker intern database. Et brugerdefineret proprietært webbaseret annotationsværktøj blev brugt til at skabe sandhed tredimensionelle binære masker svarende til de oprindelige højre og venstre nyrer og eventuelle nyretransplantationer, hvis de er til stede. Annoteringsværktøjet blev implementeret som et simpelt børsteværktøj uden nogen tærskelværdi eller avanceret konturfunktionalitet. To studerende forskere (HRT, KAPR) fungerede som de vigtigste annotatorer, og en senior radiolog (PDC) gennemgik efterfølgende hver patient og forfinede annoteringer af interesseområder, hvor det var nødvendigt.
Billedforbehandling
Ved at bruge de annoterede nyrevolumenmasker som skabelon blev hver nyre beskåret og gensamplet til et isotropt 96 3 96396 voxelvolumen. Denne gensampling operation var påkrævet for at sikre, at alle modelinput var af samme matrixstørrelse og for at imødekomme begrænsningerne ved grafikprocessorenhedshukommelse. I betragtning af mængderne varførst beskåret til højre og venstre nyre, og at nyrerne kun udgør en lille del af det oprindelige CT-volumen, var de endelige resampled voxel-størrelser ens i res.løsning på de originale data. Hvert beskåret volumen blev derefter normaliseret ved at beskære alle voxelværdier til et område på 2150 til 250 Hounsfield Units og skaleret med en faktor på 1:50. NogenEnkeltundersøgelse i dette datasæt kan indeholde op til tre individuelle afskårne nyrer, der bruges til algoritmetræning: (native) venstre, (native) højre og transplantation. For ethvert individuelt barnney, i alt 96 todimensionelle (2D) billeder (i størrelse 96396) blev brugt til træning.
CNN tilgang
To forskellige brugerdefinerede 2D CNN-netværk blev testet og sammenlignet for at skelne alvorlig fra mild/moderat nyrefibrose. Den første algoritme er en standard globalskive-for-skive CNN-klassificering, designet til at forudsige en af tre gensidigt eksklusive kategorier for hvert 2D-billede: ingen nyre, mild/moderat fibrose og svær fibrose. Detanden algoritme er en CNN-klassifikator på pixelniveau implementeret gennem en fuldt konvolutionerende U-Net-arkitektur til at udføre samtidig segmentering og klassificering. I
begge modeller ignorerer den endelige klassificering skiver eller voxels uden nyrer, og en flertalsregel er aggregeret på de resterende forudsigelser. Begge algoritmer er implementeretved hjælp af den avancerede squeeze-and-excitation-netværksarkitektur, den bedste model af ImageNet Large Scale Visual Recognition Challenge i 2017 (18).Squeeze-and-excitation-netværkstilgangen gør det muligt for netværk adaptivt at omkalibrere kanalvise funktionssvar baseret på forskellige modelinput ved at lære
indbyrdes afhængighed mellem kanaler (figur 1).

Figur 1.|Forudsigelsesvarmekort genereret af den dybe læringsalgoritme, der identificerer områder med mistanke om "alvorlig" fibrose i nyren. Fra venstre mod højre er nyrer, der spænder fra normal til svær fibrose, vist med progressive grader af estimeret fibrotisk parenkym. Endelige gennemsnitlige softmax-normaliserede forudsigelser for hele nyren vises i nederste række, der spænder fra 0.0 til 0.2; 0.2–0.4;{{0}}.4–0.6; 0.6–0.8; og 0.8-1.0.
Global Slice-by-Slice-klassificering
Den globale CNN-klassifikator er en brugerdefineret VGG-afledt arkitektur implementeret med squeeze excitationsmoduler på hvert lag. Modelindgangen er et enkelt 2D (96396) udsnitog modeloutputtet er en tre-element logit vektor, der repræsenterer en tre-klasse forudsigelse. CNN består af fire foldningsblokke, hvor hver blok er defineret som en 333foldning, batch-normalisering og ReLU gentaget tre gange i alt. Subsampling udføres i slutningen af hver blok gennem en foldning med et skridt på to. Efter
fire foldningsblokke (12 lag), bliver det endelige feature map fladt sammen og brugt som input til et enkelt fuldt forbundet lag.

Voxel-niveauklassificering
CNN-klassifikatoren på voxel-niveau er en brugerdefineret U-Netderived-arkitektur implementeret med squeeze excitationsmoduler på hvert lag (19). Modelinputtet er et enkelt 2D (96396) udsnit, og modeloutputtet er en enkelt 2D (96396) segmenteringsmaske med en forudsigelse i tre klasser ved hver voxelplacering. CNN består af fire kontraherende foldningsblokke, hvor hver blok er defineret som en 333 foldning, batchnormalisering og Leaky ReLU gentaget tre gange i alt. Subsampling udføres i slutningen af hver blok gennem en foldning med et skridt på to. Efter fire foldningsblokke (12 lag) vendes operationerne gennem en identisk netværksarkitektur med udskiftning af stridden foldninger (under-sampling) med konvolutionelle transponeringer (upsampling).
Implementering af neurale netværk
En softmax crossentropy tab-funktion bruges til at optimere begge modeller. Optimering blev udført ved hjælp af Adam-teknikken (20) med eksponentielle henfaldshastigheder, b1 og b2, indstillettil henholdsvis {{0}},9 og 0,999. Indlæringshastigheden er sat til 131023. Batchstørrelsen er sat til otte med i alt 25,000 træningsgentagelser. Xavier-normalisering bruges til at initialiserevægtene før træning (21). Algoritmekoden blev skrevet i Python 3.6, TensorFlow 2.1.0-biblioteket og Keras 1.0.8-biblioteket. Netværket er trænet på vores in-house grafikbehandlingsenhedsklynge, som indeholder 48 Nvidia GeForce RTX 2080 Ti og 12 GeForce RTX Titans. I gennemsnit trænede den globale klassifikator i 30 minutter pr. eksperiment, mens den voxel-baserede klassifikator trænede i 2-4 timer pr. eksperiment.
Evaluering
En femdobbelt krydsvalideringsstrategi blev brugt til at evaluere træningsprocessen. Selvom op til tre forskellige nyrer fra hver patient blev behandlet individuelt i løbet aftræningsproces, er alle volumener fra en enkelt patient stratificeret i den samme krydsvalideringsgruppe for at forhindre datalækage. Datasættet blev delt 80:20 og derefter trænet på80 %, hvorimod de øvrige 20 % blev brugt til validering. Træningen blev gentaget fem gange i alt med forskellige 80:20 opdelinger, indtil hele datasættet var fuldt valideret
Ud over eksperimenter på hele datakohorten, blev der udført yderligere subkohorteanalyser for at evaluere for potentielle forstyrrende variable. Stratificering blev anvendtbaseret på intravenøs kontraststatus og udelukkelse af atrofiske native nyrer hos patienter, der modtog en transplantation. Desuden, for at evaluere modellens generaliserbarhed, models trænet udelukkende fra Philips og GE scannere blev udelukkende valideret med data fra Siemens scannere.
Statistikker
Vores studiemål var at skelne mellem mild/moderat fibrose fra svær fibrose på nyre-CT-billeddannelse. Flertalsreglen blev brugt i begge tilgange (global skive for skiveog voxel-baseret) for at bestemme sværhedsgraden affibrose.For at evaluere ydeevnen mellem de to tilgange,nøjagtighed, følsomhed, specifiby, positiv forudsigelsesværdi(PPV) og negativ prædiktiv værdi (NPV) blev beregnetforsinket og sammenlignet. Området under modtageren fungererkurve (AUC) blev også beregnet ved at variere softmaxscoretærskel forfibrose classifikation og resultateting-kurve tegnet for begge tilgange til sammenligning. Beskrivtive statistik rapporteres som middelværdi6SD.