La comparació entre QPCR i RNA-seq revela els reptes de quantificar l'expressió HLA Part 2
May 25, 2023
Normalització
Hem utilitzat estimacions d'expressió en transcripcions per milió (TPM), que és la normalització estàndard produïda per Salmon i correspon a la quantitat relativa d'una transcripció determinada en una mostra. Per a qualsevol gen donat, l'estimació és simplement la suma de TPM per a les seves transcripcions. En alguns casos, quan mostrem estimacions transformades normals estàndard, vam realitzar una transformació normal de rang de les dades RNAseq mitjançant el paquet GenABEL R (Aulchenko et al. 2007), que s'aplica habitualment, per exemple, en models lineals de mapeig eQTL (Delaneau). et al. 2017).
El mapeig QTL és un mètode per estudiar el mecanisme regulador de l'expressió gènica comparant l'associació entre l'expressió gènica i el polimorfisme gènic en una població. El model lineal és un mètode de mapeig eQTL d'ús habitual, que pot utilitzar un model de regressió lineal per estimar la correlació entre l'expressió gènica i el polimorfisme gènic.
El sistema immunitari és un sistema biològic complex que protegeix el cos d'infeccions i malalties com el càncer. La regulació de l'expressió gènica té un paper important en el sistema immunitari i pot afectar el desenvolupament, la diferenciació i la funció de les cèl·lules immunitàries.
Per tant, es poden utilitzar models lineals de mapeig eQTL per analitzar la relació entre els mecanismes reguladors de l'expressió gènica i la immunitat. Per exemple, estudiar la correlació entre un determinat genotip i l'expressió d'un gen immune clau en una població pot revelar la influència d'aquest genotip en la regulació de l'expressió gènica immune. Aquesta investigació pot proporcionar una il·luminació important per al tractament i la prevenció de malalties immunitàries. Això demostra la importància de la immunitat, per la qual cosa hem de millorar la nostra immunitat cada dia. La carn picada també té efectes antivirus, anticancerígens i altres, que poden enfortir la immunitat La capacitat del sistema de resistir i millorar la immunitat del cos.

Feu clic a Beneficis per a la salut del cistanche
Llegir l'alineació amb el genoma de referència
Per a l'anàlisi de la cobertura de lectura dels gens HLA informats a la figura S7, hem alineat les lectures amb el genoma de referència GRCh38 amb STAR v2.7.3a (Dobin et al. 2013), utilitzant les anotacions del gen Gencode v37. Per controlar el biaix de mapeig dels gens HLA, vam processar encara més els fitxers BAM amb hlamapper v4.3 (Castelli et al. 2018).
Simulació
Dades sobre la veritat
Per generar dades simulades, primer vam executar Salmon v1.3.0 (Patro et al. 2017) a la mostra real #66K00003 per conèixer els nivells d'expressió de les transcripcions Gencode v37. A continuació, vam utilitzar el paquet Polyester (v1.26.0) per generar 50 mostres sintètiques amb nivells d'expressió idèntics a tot el transcriptoma, excepte HLA-A, -B i -C. Els nivells d'expressió d'aquests gens es van basar en 50 individus escollits aleatòriament a partir de les nostres dades reals (per a les quals tenim dades d'al·lel HLA disponibles). Per a cada gen HLA, vam seleccionar les isoformes que representaven almenys el 90 per cent de l'expressió total de la transcripció que codificava proteïnes en una execució de salmó al conjunt de dades real (que va donar lloc a només 1 transcripció per gen) i vam personalitzar les seqüències de transcripció segons el Al·lels HLA portats per cada individu.
Aquest procediment ens va permetre generar sintèticament 50 individus amb nivells d'expressió de fons idèntics, però amb expressió HLA variable i amb polimorfisme HLA incorporat a les lectures simulades.
Per reflectir les nostres dades reals, es van simular trenta milions de lectures d'extrem aparellat de 126 bp amb una mida mitjana de fragment de 261 bp per a cada individu, utilitzant els valors predeterminats per a altres paràmetres de polièster (p. ex., la desviació estàndard de la longitud del fragment=25 pb, taxa d'error=0.005, distribució uniforme de lectures i sense biaix). Polyester produeix fitxers FASTA, a partir dels quals hem produït fitxers FASTQ amb un nivell de qualitat constant (símbol "F") corresponent.
Mètriques per a la precisió
Els TPM es van calcular a partir de recomptes simulats tenint en compte la longitud de la transcripció i la mida mitjana dels fragments de 261 pb. La relació "TPM estimat/TPM veritable" s'utilitza per avaluar el rendiment en la recuperació dels nivells d'expressió simulats i ens permet observar la baixa o la sobreestimació.
Gràfics
Hem preparat totes les trames d'aquest article utilitzant el paquet ggplot2 v3.3.2 (Wickham 2016) a R.

Resultats
Precisió de la quantificació d'ARN-seq HLA
Donada l'absència d'un mètode que es pugui considerar l'estàndard d'or experimental per a la quantificació d'expressió HLA a partir de dades d'ARN-seq, inicialment es va avaluar la precisió dels mètodes de quantificació d'ARN-seq per a HLA mitjançant dades simulades on es coneixen els nivells d'expressió reals ja que es generen. en un ordinador per emular experiments reals. Això es va fer per triar el millor enfocament computacional entre els mètodes basats en ARN-seq, permetent un contrast posterior amb enfocaments que no siguin ARN-seq.
Hem simulat un experiment d'ARN-seq per a 50 individus mitjançant el paquet Polyester (Frazee et al. 2015). Aquests individus sintètics tenen els mateixos nivells d'expressió per a tots els gens del genoma, excepte per a HLA-A, -B i -C, per als quals vam variar els nivells d'expressió. També vam personalitzar les seqüències de transcripció HLA anotades de Gencode v37 per introduir una variació genètica real observada en individus escollits aleatòriament d'un conjunt de dades de 96 individus (que van ser genotipats HLA mitjançant la seqüenciació de Sanger tal com es descriu a continuació). Les transcripcions personalitzades resultants tenien una identitat de seqüència mitjana amb una referència superior al 95 per cent per a tots els loci HLA.
Hem comparat les estimacions de l'expressió HLA obtingudes per dos mètodes bioinformàtics: (1) "Ref transcriptome", que utilitza Salmon (Patro et al. 2017) per alinear les lectures amb el transcriptoma de referència estàndard, quantificant l'abundància de transcripcions i (2) "Personalitzat". que també utilitza salmó, però els mapes es llegeixen a transcripcions HLA personalitzades, reflectint el genotip HLA de l'individu (Fig. 1). L'enfocament "personalitzat" amplia la nostra estratègia anterior (Aguiar et al. 2019) mitjançant l'ús d'una transcripció personalitzada, en lloc d'una única seqüència de codificació canònica per a cada al·lel portat per l'individu.

El mètode "Ref transcriptome" va subestimar els nivells d'expressió, en particular per als al·lels amb una proporció més gran de diferències de seqüència pel que fa al genoma de referència (Fig. 1). Això s'espera ja que una taxa de desajust més alta entre les lectures i la referència afecta negativament l'alineació (Brandt et al. 2015). Aquest enfocament també va sobreestimar l'expressió HLA-C d'alguns individus, com a conseqüència de les lectures de HLA-B que es van mapar a les transcripcions de referència HLA-C (Fig. S1). L'enfocament "personalitzat", d'altra banda, controla el biaix de mapeig i aconsegueix una precisió òptima.
Tot i que la nostra simulació proporciona resultats encoratjadors pel que fa a la quantificació de l'expressió HLA mitjançant RNAseq, hem de tenir en compte algunes advertències. Hem modificat la seqüència de les isoformes anotades segons els al·lels HLA dels individus mitjançant un únic conjunt d'isoformes per a tots els al·lels d'un gen HLA determinat. Aquestes seqüències es van utilitzar tant en la simulació de lectures com en la quantificació de l'expressió; per tant, esperem una precisió òptima. En un escenari real, diferents al·lels HLA podrien estar associats amb diferents isoformes. Més endavant en aquest article, discutim un exemple específic que vam observar per a HLA-A, coherent amb la hipòtesi que certes isoformes són exclusives d'al·lels específics. No obstant això, atès que estem interessats principalment en les estimacions d'expressió a nivell de gens i HLA, esperem que les seqüències personalitzades representin una millora respecte a un únic transcriptoma de referència reduint el biaix de mapeig.
Estimació de l'expressió HLA a partir de dades reals d'ARN-seq
Hem realitzat una estimació d'expressió en dades d'ARN-seq del transcriptoma sencer per a 96 individus, per a les quals es van estimar prèviament els nivells d'expressió superficial de qPCR per a HLAA, -B i -C i HLA-C (Kulkarni et al. 2013; Ramsuran et al. 2015, 2017) i es podria utilitzar per comparar amb els resultats de RNAseq (vegeu la figura S2 per a les anàlisis de control de qualitat de les dades d'ARN-seq).
Atesa la major precisió de l'enfocament personalitzat a la simulació, contrastem aquest mètode d'estimacions d'expressió basades en ARN amb la d'altres enfocaments que no són ARN-seq, però proporcionem els resultats dels enfocaments basats en el transcriptoma de referència a la "Informació suplementària. " Vam personalitzar les seqüències de transcripció tenint en compte els genotips HLA individuals obtinguts mitjançant la seqüenciació de Sanger. Vam executar HLApers (Aguiar et al. 2019) i Kourami (Lee i Kingsford 2018) per inferir al·lels directament a partir de les dades d'ARN-seq i confirmar les trucades de Sanger (vegeu "Materials i mètodes").
Les estimacions d'expressió a nivell gènic mostren que HLA-B té la més alta expressió entre els loci HLA del nostre conjunt de dades, seguit de HLA-C i HLA-A (Fig. 2A). Aquesta ordenació és coherent amb el conjunt de dades de sang sencera GTEx (GTEx Consortium 2020) i amb un mètode RNAseq de captura HLA anterior aplicat als PBMC (Yamamoto et al. 2020). Tanmateix, aquest patró difereix del vist per Boegel et al (2018), que van observar nivells similars entre gens utilitzant una estratègia diferent per fer front al mapatge de lectures a múltiples loci, cosa que pot contribuir a la manca de distinció entre els loci pel que fa al nivell d'expressió. ). Els estudis futurs hauran de separar la contribució de les diferències en metodologies o composició de tipus cel·lular a aquestes diferències.

Comparació d'ARN-seq i qPCR en dades reals
A continuació, vam comparar les estimacions d'expressió d'ARN-seq amb les obtingudes amb qPCR (Fig. 2B). Tot i que la correlació entre l'expressió ARN-seq i qPCR va ser estadísticament significativa per a tots els gens (p=0.{024, 0,002, 0,000000016, per a HLA-A, -B i -C, respectivament; prova de Spearman per a l'associació positiva), la magnitud de les correlacions va ser modesta per a HLA-A i -B, i més alta per a -C. L'ús d'una referència personalitzada per a RNA-seq va augmentar modestament la correlació amb qPCR en comparació amb una referència estàndard (Fig. S3). Això coincideix amb la nostra observació anterior que les estimacions d'expressió a nivell gènic no són substancialment diferents entre els enfocaments personalitzats o basats en el genoma de referència per als gens HLA de classe I (Aguiar et al. 2019), i el principal benefici dels enfocaments personalitzats són les estimacions a la Nivell d'al·lel HLA, que explorem a continuació. L'ús de la correcció del biaix en el salmó (biaix GC, biaix específic de la seqüència i biaix específic de la posició) millora la correlació amb qPCR, amb el major impacte per a HLA-B (compareu les Figs. 2B i S4, per a dades corregides i no corregides, respectivament).

Comparació dels nivells d'ARNm amb l'expressió superficial
Com que l'expressió d'ARN és informativa sobre els passos inicials de la senyalització cel·lular i la resposta als estímuls, l'anàlisi de la seva relació amb els fenotips moleculars aigües avall (com l'expressió de proteïnes a la superfície cel·lular) ens pot ajudar a entendre el paper de la regulació post-transcripcional i post-traduccional en Expressió HLA. S'esperen diferències entre l'abundància d'ARN i proteïnes, ja que estan subjectes a diferents modes de regulació. Els efectes tècnics també poden introduir diferències, ja que les tècniques d'ARN i proteïnes difereixen i es veuen afectades per tipus d'error no correlacionats (Li i Biggin 2015; Kaur et al. 2017; Carey et al. 2019). A més, en el cas del nostre estudi, l'expressió gènica es va mesurar en PBMC totals, mentre que l'expressió de proteïnes es va mesurar en cèl·lules CD3 més ordenades. Tenint en compte aquesta diferència, vam mesurar el grau en què es pot predir la proteïna HLA a la superfície cel·lular mitjançant l'expressió d'ARNm. Aquesta anàlisi es va realitzar exclusivament per a HLA-C, ja que és l'únic locus per al qual està disponible un anticòs que pot unir tots els al·lels amb afinitats iguals. Curiosament, hi va haver una alta correlació entre l'ARNm i l'expressió de proteïnes per a HLAC, amb una correlació lleugerament superior per a l'ARN-seq (Fig. 2C).
Expressió a nivell d'al·lel HLA
Els gens HLA alberguen elements reguladors associats amb la transcripció constitutiva i la transcripció activada dinàmicament (René et al. 2016). Com a resultat, l'expressió HLA varia entre els teixits i pot ser modulada per xarxes reguladores desencadenadas per diferents estímuls (Anderson 2018; Carey et al. 2019). Hi ha un interès creixent per entendre si els diferents al·lels HLA estan associats amb diferents nivells d'expressió basal i programes reguladors (Aguiar et al. 2019; Gutierrez-Arcelus et al. 2020) i si aquesta variació contribueix als fenotips de la malaltia o als resultats del trasplantament (Petersdorf et al. 2019). al. 2014, 2015; René et al. 2016; Bettens et al. 2022; Johansson et al. 2022). Per tant, es van comparar les estimacions d'expressió a nivell d'al·lel HLA per a qPCR i RNA-seq. Com que els al·lels individuals solen ser força rars al conjunt de dades, els vam agrupar per llinatges al·lèlics (és a dir, grups d'al·lels que es defineixen filogenèticament per la relació d'exons) (Elsner et al. 2002).
Vam classificar els llinatges segons els seus nivells d'expressió basant-nos tant en dades d'ARN-seq com en qPCR i vam avaluar la concordança de les classificacions entre els mètodes (Fig. 3). El nostre enfocament personalitzat d'ARN-seq proporciona directament estimacions a nivell d'al·lel, ja que les seqüències d'al·lel HLA s'utilitzen per indexar les alineacions, de manera que vam ordenar els llinatges al·lèlics segons els seus nivells d'expressió mitjans. Com que les nostres estimacions d'expressió de qPCR es troben a nivell gènic i no proporcionen directament estimacions a nivell d'al·lel, vam ordenar llinatges al·lèlics segons els seus efectes en un model lineal dels nivells d'expressió explicats pel genotip HLA (vegeu Ramsuran et al. 2015). A la figura 3, els valors d'expressió es representen dues vegades per a cada nivell per a cada al·lel de l'individu, i per a qPCR, és simplement l'expressió a nivell gènic representada dues vegades, que reflecteix la presència de dos al·lels.

L'ordenació de les estimacions d'expressió és més similar entre RNA-seq i qPCR per a HLA-C que per a -A i -B (diferència d'ordre absolut mitjà, on la diferència d'ordre es refereix a la diferència observada en posicions dins d'un ordre classificat dels valors d'expressió , entre la quantificació d'ARN-seq i qPCR, de 2,3 per a HLA-C, 3,1 per a -A i 3,9 per a -B), seguint un patró similar d'acord al de l'expressió a nivell gènic, per a la qual hem trobat la correlació més alta. entre RNA-seq i qPCR per HLA-C.
Entre els llinatges amb la diferència més gran entre RNA-seq i qPCR hi ha A*11. Vam mesurar l'expressió superficial en un subconjunt d'heterozigots per a A * 03 o A * 11 mitjançant un anticòs que té la mateixa afinitat per ambdós llinatges i vam observar que la qPCR es correlaciona de manera més sòlida amb l'expressió de la superfície cel·lular d'aquests dos al·lotips que no pas l'ARN-seq (Fig. S5). A continuació, presentem una avaluació més extensa de les ordenacions d'al·lels mitjançant comparacions amb estudis anteriors d'expressió d'ARNm HLA.
Tot i que hi ha interès a comparar les diferències d'expressió entre al·lels HLA, diversos estudis mostren que la variació en l'expressió dins d'un al·lel o un llinatge al·lèlic sovint és força elevada, i les diferències entre al·lels de diferents rangs solen ser petites i no significatives. Com a conseqüència, pot ser poc realista esperar el manteniment dels rangs entre múltiples al·lels, i pot ser preferible comparar les estimacions d'expressió dels al·lels als extrems d'expressió.
Per a les nostres dades d'ARN-seq, comparem les nostres estimacions amb les de dos enfocaments anteriors d'ARN-seq adaptats a HLA en PBMC. Hi ha una bona concordança general amb Yamamoto et al. (2020), on A*24, A*02, C*04 i C*06 estan molt expressats, i A*03, C*03 i B*15 s'expressen en nivells baixos, tot i que també veiem diferències com pel que fa a B*35, que estaria més d'acord amb les nostres dades de qPCR. Quan comparem les nostres dades d'ARN-seq amb Johansson et al. (2021), però, veiem moltes més diferències, tot i que tenen mostres molt petites per a molts llinatges.
També contrastem els nostres resultats amb els de dos estudis anteriors de qPCR que van aplicar primers específics d'al·lel. Bettens et al. (2014) van utilitzar cebadors específics d'al·lels per a alguns llinatges HLAC i van veure que C * 04 i C * 06 s'expressaven molt, mentre que C * 07 i C * 03 s'expressaven a nivells baixos, d'acord amb el que tenim per a ARN-seq. i qPCR. René et al. (2015) van aplicar cebadors específics d'al·lel per a HLA-A i van observar A * 02 (alt) i A * 29 (baix) als extrems d'expressió, cosa que coincideix més amb els nostres resultats RNAseq que amb la nostra qPCR; tanmateix, veiem moltes diferències en altres llinatges al·lèlics
En alguns casos, també podem avaluar la concordança amb estudis funcionals. Per exemple, anàlisis anteriors dels llocs d'unió del factor de transcripció (TFBS) i l'activitat del promotor (revisat a Anderson 2018) i estudis sobre la regulació de miRNA (Kulkarni et al. 2011), mostren que C * 03 i C * 07 són al·lels dèbilment expressats, que coincideix amb les nostres observacions tant per a RNA-seq com per qPCR.
Fonts potencials de diferències
A continuació, vam investigar si el processament de les mostres utilitzades per a RNA-seq podria haver contribuït a les diferències entre les estimacions d'expressió obtingudes amb qPCR i RNA-seq.
Una preocupació específica va ser el temps que es van emmagatzemar les mostres en un congelador de -80 graus (aproximadament 4 anys entre els assajos qPCR i RNA-seq), així com altres passos específics per a l'experiment RNA-seq, inclosa la descongelació de mostres. Per solucionar-ho, vam realitzar un segon experiment de RNAseq amb sang fresca extreta d'11 individus, que són un subconjunt dels 96 analitzats en aquest estudi, i vam comparar les estimacions d'expressió entre els dos punts de temps. Tot i que aquest segon assaig comporta diferències tècniques i biològiques pel que fa al primer experiment d'ARN-seq (Fig. S6A i B), la correlació a tot el transcriptoma en les estimacions d'expressió entre punts de temps és alta (Fig. S6C).
Tot i que l'avaluació de la correlació amb 11 individus pot ser sorollós, les correlacions en els gens HLA es troben entre les correlacions genètiques més grans entre les dues mostres (Fig. S6D i F). També vam calcular les proporcions d'al·lels individuals, que és la relació d'expressió entre els dos al·lels HLA d'un individu heterozigot, i les vam comparar entre punts de temps. La correlació va ser superior a 0.94 per a HLA-A, -B i -C (Fig. S6E). Per tant, no vam veure cap evidència d'una contribució important de la degradació de l'ARN per explicar la baixa correlació entre RNA-seq i qPCR a la nostra mostra original.
Una altra possible contribució a les diferències entre RNA-seq i qPCR és que l'al·lel HLA específic pot estar més esbiaixat en un mètode o en un altre, en aquest cas els individus que porten aquests al·lels contribuirien a grans diferències. Per exemple, per als individus que porten A * 03, o per als homozigots per a C * 07, hi ha una relació negativa entre qPCR i ARN-seq (Fig. 4A).

Una font addicional de diferències entre els mètodes podria sorgir del fet que, en el nostre enfocament RNA-seq, personalitzem totes les transcripcions anotades Gencode per a cada al·lel HLA; tanmateix, la veritable diversitat de transcripcions i la seva associació amb al·lels HLA específics no s'entenen bé. Per exemple, Kulkarni et al. (2017) van demostrar que A*01 i A*11 produeixen 3′-UTR més curts. Per investigar si podem replicar aquest finançament a les nostres dades d'ARN-seq, vam mapejar les lectures al genoma de referència i vam corregir el biaix de mapeig dels gens HLA amb un mapeador hla (Castelli et al. 2018). De fet, per a les persones que porten A * 01 o A * 11, la cobertura de lectura al 3′-UTR de HLA-A mostra una forta caiguda a ~ 120 pb abans de l'extrem del gen anotat (Fig. S7).

Com que els valors de transcripció per milió (TPM) es calculen tenint en compte la longitud de referència, utilitzar una referència que sigui més llarga que la transcripció veritable condueix a una subestimació de l'expressió. Hem intentat controlar la possibilitat d'aquestes transcripcions més curtes incloent una versió de cada transcripció HLA-A amb un 3′-UTR escurçat al nostre índex per a l'alineació de lectura. Tanmateix, no hem trobat cap evidència d'expressió de la isoforma més curta (Fig. S8), possiblement perquè aquestes isoformes més curtes estan contingudes dins de les isoformes de longitud normal, i la implementació de Salmon assigna totes les lectures a la isoforma més gran. Curiosament, l'expressió a nivell d'isoforma revela una isoforma amb un 5′-UTR més llarg exclusiu d'A*11, que aporta una gran proporció de l'expressió total d'aquest al·lel (Fig. S8).
També vam provar una normalització de les nostres estimacions d'expressió, en què vam ajustar les longituds de lectura donada la cobertura de lectura que admet un terminal 3′-UTR proximal o distal (mitjana ponderada de les longituds de la transcripció utilitzant la cobertura de lectura com a pesos). Tot i que observem un guany de fins a un 20 per cent en els nivells d'expressió per a individus que porten A*01 i/o A*11, només veiem una petita millora en la correlació amb qPCR després d'aquest ajust (de rho=0. 20 a la figura 2 a rho=0.24 a la figura 4B).
A * 01 i A * 11 es troben entre els al·lels amb les diferències de rang més grans entre RNA-seq i qPCR (Fig. 3), i una representació imperfecta de les seves transcripcions associades a l'anotació pot introduir biaix en les nostres estimacions d'ARN-seq.
Finalment, els mètodes de normalització utilitzats per obtenir estimacions d'expressió finals a partir de les dades de qPCR en brut també poden ser una font de diferències entre les estimacions de qPCR i ARN-vegeu. Els assaigs quantitatius de PCR per als gens HLA de classe I solen amplificar regions dins dels exons 1 a 4, i normalment es realitza l'estandardització mitjançant l'expressió d'un gen domèstic com ara B2M (2-microglobulina) (com va ser el cas en el present estudi). ). La justificació d'aquest procediment és que si els nivells d'expressió estan estandarditzats per una referència expressada de manera estable, les estimacions per a diferents individus es posen a la mateixa escala, permetent així comparacions entre individus.
B2M codifica per a la cadena lleugera a la molècula HLA de classe I, i és plausible que els gens B2M i HLA de classe I tinguin certa coordinació d'expressió, ja que comparteixen arquitectures de promotors similars (Kobayashi i van den Elsen 2{{1{{12} }}}12; Vijayan et al. 2019), i pot ser regulat per factors de transcripció compartits (per exemple, NLRC5/CITA indueix l'expressió tant de HLA classe I com de B2M a les línies cel·lulars Jurkat (Meissner et al.). al. 2{{20}}10). La normalització de l'expressió del gen HLA mitjançant valors correlacionats pot introduir biaix en les nostres estimacions de qPCR, especialment per a HLA-B, per a la qual veiem un alt correlació amb l'expressió B2M (Fig. 4C) L'escala d'una variable per una variable diferent però correlacionada pot introduir pertorbacions al portar valors extrems al centre de la distribució i reduir la variància; d'acord amb aquesta hipòtesi, els coeficients de variació de les dades de qPCR són 0,61 i 0,50 per a HLA-A i -C, respectivament, però baixa a 0,17 per a HLA-B (com a comparació, els CV de les dades d'ARN-seq són 0,20, 0,14 i 0,29 per a HLA-A, -B i -C). , respectivament). Tanmateix, utilitzant el mateix disseny de qPCR, Ramsuran et al. (2017) van normalitzar l'expressió HLA-B tant pel gen B2M, GAPDH, 18 s i b-Actina, i van observar resultats molt consistents, que no admeten un impacte de la normalització de B2M a les estimacions de qPCR.
Discussió
Les estimacions fiables de l'expressió de la transcripció HLA poden contribuir a diverses qüestions d'investigació, i tot i que el resultat de la malaltia s'explora amb freqüència en el context de la variació de la codificació HLA, és probable que els nivells d'expressió també expliquin la variació en els resultats clínics (revisat a Dendrou et al. 2018; i a Johansson et al 2022). Els nivells d'expressió també tenen el potencial d'informar les decisions a l'hora de planificar el trasplantament de cèl·lules mare hematopoètiques; per exemple, si una concordança perfecta no està disponible en la selecció per als donants al·logènics, sembla beneficiós seleccionar aquells que no coincideixen amb al·lels d'expressió baixa (Petersdorf et al. 2014, 2015). Les estimacions fiables de l'expressió de la transcripció també poden ajudar a la identificació d'eQTLs que subjauen al control de l'expressió HLA, que es podrien integrar a les troballes de GWAS, consultant si els èxits coneguts a la regió MHC coincideixen amb els eQTL per als gens HLA (vegeu, per exemple, la taula S6 a Aguiar et al. 2019). De manera més general, les estimacions millorades de l'expressió de la transcripció de l'HLA ens ajudaran a entendre l'arquitectura genètica de la regulació de l'HLA, identificant la contribució relativa de les variants que actuen en cis (és a dir, les del veïnat del gen HLA que regulen) i les variants de transacció (les que estan a distància). localitzacions genòmiques, fins i tot en altres cromosomes). Això proporcionarà informació sobre el grau en què la variació en l'expressió HLA és una propietat específica de l'al·lel enfront d'una característica interindividual independent de la identitat al·lèlica (vegeu Bettens et al. 2022).
Les tècniques quantitatives de PCR ens han permès descobrir associacions entre l'expressió HLA i els fenotips de la malaltia. Més recentment, RNA-seq s'ha convertit en el mètode d'elecció per avaluar l'expressió gènica en grans conjunts de dades de transcriptoma sencer de diferents poblacions. Ser capaç d'extreure informació precisa per a l'expressió HLA d'aquestes dades és un repte important, i s'han proposat molts mètodes per aconseguir aquest objectiu. Tanmateix, actualment es desconeix el grau en què els resultats que sorgeixen de les anàlisis d'ARN-seq coincideixen amb els acumulats per l'ús de qPCR. Tot i que aquests mètodes tenen com a objectiu el mateix fenotip molecular (abundància d'ARN), difereixen notablement en les tècniques experimentals utilitzades, les formes d'anàlisi i normalització de les dades, els procediments bioinformàtics i els biaixos als quals estan subjectes.
Segons el nostre coneixement, estudis anteriors que comparaven enfocaments d'ARN-seq adaptats a HLA amb qPCR van incloure mostres petites. Per exemple, Johansson et al. (2021) van validar el seu ARN-seq dirigit a HLA amb qPCR en només 5 mostres a HLA-C, finançant un coeficient de correlació de Pearson de 0,9, que no va ser significatiu (p=0,08) .
En el present estudi, hem comparat les estimacions quantitatives d'expressió de PCR i ARN-seq per al gen clàssic HLA classe I HLA-A, -B i -C en un conjunt igualat de 96 individus. Hem trobat correlacions modestes però significatives en l'expressió en una mostra de 96 individus. Donada la manca d'un estàndard d'or amb el qual comparar aquestes estimacions, els errors d'estimació i els biaixos associats amb ambdós mètodes poden contribuir al resultat global.
Hem explorat els efectes de diversos factors que poden explicar la baixa correlació entre les estimacions d'ARN-seq i qPCR, com ara una mala estimació de l'expressió d'al·lels HLA específics i la normalització per part d'un únic gen domèstic en qPCR. Els nostres resultats no es poden generalitzar a tots els dissenys de qPCR o pipeline RNA-seq, per als quals hi ha una gran varietat d'enfocaments diferents. Tanmateix, que sabem, aquesta és la primera comparació directa entre qPCR i ARN-seq per a l'estimació de l'expressió HLA.
El nostre estudi suggereix àrees que requereixen una millora en la determinació de l'expressió de la transcripció HLA. Les comparacions entre RNA-seq i qPCR, per exemple, haurien d'emprar un processament uniforme de mostres a través dels mètodes (per exemple, el mateix protocol d'aïllament de l'ARN, temps d'emmagatzematge/descongelació, integritat de l'ARN) per limitar les diferències artefactes associades a aquests mètodes. L'assignació de lectures breus a genomes o transcriptomes de referència únic genera biaixos i són necessàries estratègies de mapes que tinguin en compte el polimorfisme HLA. Atès que hi ha diverses estratègies per aconseguir-ho (Boegel et al. 2012; Lee et al. 2018; Aguiar et al. 2019; Gutierrez-Arcelus et al. 2020; Darby et al. 2020), serà clau comparar les precisió relativa d'aquests enfocaments.
També hi ha una necessitat de desenvolupar mètodes que tinguin en compte adequadament la variació de les isoformes, no només per proporcionar una altra capa d'informació sinó també estimacions d'expressió més precises, ja que la normalització dels recomptes de lectura per una longitud de transcripció incorrecta és una font potencial d'error. En aquest context, les dades de lectura llarga, que generen directament informació de transcripció completa, poden ser una eina potent (Cornaby et al. 2022). Finalment, també s'ha de tenir en compte la variació del nombre de còpies, una característica coneguda per a certs loci HLA (per exemple, DRB), quan es quantifiquen els nivells d'expressió.
Agraïments
Donem les gràcies a Tatiana Torres (Universitat de São Paulo), Yang Luo (Harvard Medical School) i als membres del Joint Biology Consortium de Boston, per les seves útils discussions.
Contribució de l'autor
Diogo Meyer, Mary Carrington, Richard M. Single i Vitor RC Aguiar van contribuir a la concepció i disseny de l'estudi. La preparació del material, la recollida de dades i els experiments van ser realitzats per Maureen P. Martin, Veron Ramsuran, Smita Kulkarni, Arman Bashirova, Danillo G. Augusto i Mary Carrington. L'anàlisi de dades va ser realitzada per Vitor RC Aguiar, Erick Castelli, Richard M. Single, Maria Gutierrez-Arcelus i Diogo Meyer. El manuscrit va ser escrit per Vitor RC Aguiar i Diogo Meyer. Tots els autors van llegir, van fer contribucions i van aprovar el manuscrit final.
Finançament
L'Agència de Finançament de São Paulo (FAPESP, http://www.fapesp. br/en/) va proporcionar finançament a DM (2012/18010-0 i 2013/22007-7) i a VRCA (2014/{{ 5}} i 2016/24734-1). Els National Institutes of Health, EUA, van proporcionar finançament a DM (NIH R01 GM075091), que va donar suport a part del postdoc VRCA. El Conselho Nacional de Desenvolvimento Científco e Tecnológico (CNPq) i el Ministeri de Salut del Brasil van proporcionar finançament per als experiments d'ARN-seq i les visites de viatge de recerca, com a part d'una proposta conjunta entre els EUA i el Brasil atorgada a MC i DM (470043/{{13} }). NIH/NIAID R01AI157850 és compatible amb SK. La VR va ser finançada pel South African Medical Research Council (SAMRC) amb fons del Departament de Ciència i Tecnologia (DST); i també recolzat en part a través de la Xarxa d'Àfrica Subsahariana per a l'Excel·lència en la Recerca sobre la TB/VIH (SANTHE), una iniciativa DELTAS Africa (subvenció núm. DEL-15-006) de l'AAS.
Aquest projecte s'ha finançat totalment o parcialment amb fons federals del Frederick National Laboratory for Cancer Research, sota el contracte núm. HHSN261200800001E. El contingut d'aquesta publicació no reflecteix necessàriament les opinions o polítiques del Departament de Salut i Serveis Humans, ni la menció de noms comercials, productes comercials o organitzacions implica l'aprovació del govern dels EUA. Aquesta investigació va comptar amb el suport en part del Programa de Recerca Intramural del NIH, Frederick National Lab, Centre d'Investigació del Càncer.
Disponibilitat de dades
Les dades d'ARN-seq presentades a la publicació actual s'han dipositat i estan disponibles a la base de dades dbGaP sota l'adhesió dbGaP phs003177.v1.p1.
Referències
1. Aguiar VRC, César J, Delaneau O, et al (2019) Estimació d'expressió i mapeig eQTL per a gens HLA amb un pipeline personalitzat. PLoS Genet 15:e1008091.
2. Alcina A, Abad-Grau MDM, Fedetz M et al (2012) La variant de risc d'esclerosi múltiple HLA-DRB1 * 1501 s'associa amb una alta expressió del gen DRB1 en diferents poblacions humanes. PLoS One 7:e29819.
3. Anderson SK (2018) Evolució molecular dels elements que controlen l'expressió HLA-C: adaptació a un paper com a lligand del receptor semblant a la immunoglobulina de cèl·lules assassines que regula la funció de les cèl·lules assassines naturals. HLA 92:271–278.
4. Apps R, Meng Z, Del Prete GQ et al (2015) Relative expression levels of the HLA class-I proteins in normal and HIV-infected cells. J Immunol 194:3594–3600.
5. Apps R, Qi Y, Carlson JM, et al (2013) Influence of HLA-C expression level on HIV control. Science 340:87–91.
6. Arshad N, Laurent-Rolle M, Ahmed WS et al (2023) Les proteïnes accessories SARS-CoV-2 ORF7a i ORF3a utilitzen mecanismes diferents per regular a la baixa l'expressió superficial de MHC-I. Proc Natl Acad Sci USA 120:e2208525120.
7. Aulchenko YS, Ripke S, Isaacs A, van Duijn CM (2007) GenABEL: una biblioteca R per a l'anàlisi d'associacions a tot el genoma. Bioinformàtica 23:1294–1296.
8. Bachtel ND, Umviligihozo G, Pickering S, et al (2018) La regulació a la baixa de l'HLA-C pel VIH-1 s'adapta al genotip HLA hoste. PLoS Pathog 14:e1007257.
9. Bettens F, Brunet L, Tiercy JM (2014) Alta variabilitat al·lèlica en l'expressió de l'ARNm HLA-C: associació amb haplotips estesos amb HLA. Genes Immun 15:176–181.
10. Bettens F, Ongen H, Rey G et al (2022) Regulació de l'expressió HLA classe I per variacions de gens no codificants. PLoS Genet 18:e1010212
11.Boegel S, Bukur T, Castle JC, Sahin U (2018) In Silico Typing of Classical and Non-classical HLA Alleles from Standard RNA-Seq Reads. Mètodes Mol Biol 1802:177–191.
For more information:1950477648nn@gmail.com






