Cistanche Deserticola -lihaisen varren RNA-Seq-pohjainen De Novo -transkriptomien kokoonpano ja geenin löytäminen -Ⅰ
Sep 03, 2024
Taustat
Cistanche deserticola on täysin ei-fotosynteettinen loiskavi, jolla on suuri lääkearvo ja jota esiintyy pääasiassa Luoteis-Kiinan autiomaassa. Sen kuivattu mehevä varsi on tärkeä tonicperinteinen kiinalainen lääketiedePääasiassa miehen seksuaalisen toiminnan parantamisessa ja immuniteetin vahvistamisessa, mutta mekanistisia tutkimuksia on tehty vain vähän osittain genomisten ja transkriptomisten resurssien puutteen vuoksi.

LUONNOLLINEN CISTANCHE TUBULOSA KIINAN PERINTEINEN LÄÄKE PHGS75% ECH 30% ACT 12%
Tulokset
Tässä tutkimuksessa suoritimme syvän transkription sekvensoinnin C. deserticolan mehevässä varressa, ja noin 80 miljoonaa lukua luotiin käyttämällä Illumina-paripääsekvensointia HiSeq2000-alustalla. Trinity-asentajaa käyttämällä saimme 95 787 transkriptisekvenssiä, joiden transkriptin pituus vaihteli välillä 200 bp - 15 698 bp ja joiden keskimääräinen pituus oli 950 emästä ja N50-pituus 1 519 emästä. 63 957 transkriptia tunnistettiin aktiivisesti ekspressoituneeksi FPKM:llä, joka on suurempi tai yhtä suuri kuin 0,5, joista 30 098 transkriptiin oli merkitty geenikuvaukset tai geeniontologian termit sekvenssien samankaltaisuusanalyyseillä useissa julkisissa tietokantoissa (Uniprot, NR ja Nt NCBI:ssa ja KEGG). . Lisäksi tunnistimme avainentsyymigeenejä, jotka osallistuvat ligniinin ja fenyylietanoidiglykosidien (PhG:iden) biosynteesiin, joiden tiedetään olevan ensisijaisia vaikuttavia aineita. Sekvenssivertailun ja fylogeneettisen analyysin perusteella tunnistettiin neljä fenyylialaniiniammonia-lyaasi (PAL) -geeniä, joka on ensimmäinen avainentsyymi ligniinin ja PhG:n biosynteesissä. Ensimmäistä kertaa ehdotettiin myös kahta PhG:iden biosynteesireittiä.
Johtopäätökset
Kaiken kaikkiaan saimme päätökseen globaalin analyysin C. deserticolan mehevän varren transkriptistä RNA-seq-tekniikalla. Kokoonpantuista ja annotoiduista transkripteistä tunnistettiin kokoelma entsyymigeenejä, jotka liittyvät ligniinin ja fenyylietanoidiglykosidien biosynteesiin, ja myös PAL:n geeniperhe ennustettiin. Tämän tutkimuksen sekvenssitiedot tarjoavat arvokkaan resurssin tulevien fenyylietanoidiglykosidien biosynteesitutkimusten ja funktionaalisten genomitutkimusten suorittamiseen tässä tärkeässä lääkekasvissa.
Johdanto
C. deserticola on maailmanlaajuinen monivuotisten aavikkokasvien suku Orobanchaceae-perheestä ja on täysin ei-fotosynteettinen laji ja kasvaa yleensä maanalaisen holoparasiittisen kasvin alla. Se loistuu psammofyytin Haloxylon ammodendron (Chenopodiaceae) juuriin. Se asuu pääasiassa aavikoissa ja puoliaavioissa, koska se sietää hyvin kuivuutta ja suolaisuutta. C. deserticola kestää hyvin ankaria ympäristöolosuhteita, ja sitä esiintyy pääasiassa Luoteis-Kiinassa, erityisesti Sisä-Mongoliassa, Gansussa ja Xinjiangissa. Sitä on pidetty viime vuosina uhanalaisena luonnonvaraisena lajina ihmisten lisääntyneen kulutuksen vuoksi. C. deserticola, jota usein kutsutaan aavikon ginsengiksi, tunnetaan yleisesti aavikkoluutarapena ja kuivattua mehevää vartta on käytetty laajasti perinteisesti tärkeänä tonicina Kiinassa ja Japanissa useiden vuosien ajan. Se tallennettiin alun perin Shen Nong Ben Cao Jingiin (Kiinan Materia Medican sanakirja, 1977) noin 1800 vuotta sitten, ja sitä pidettiin yhtenä tärkeimmistä lähteistäKiinalainen lääkeyrtti Cistanche.

LUONNOLLINEN CISTANCHE TUBULOSA SEKSUAALITOIMINNON PARANTAMISEEN PHGS75% ECH 30% ACT 12%
C. deserticolan uutteilla on laaja valikoima lääkinnällisiä toimintoja, erityisesti käytettäväksi seksuaalisen toiminnan parantamisessa, munuaisten vahvistamisessa, maksan suojaamisessa, aperienttiaktiivisuudessa, muistin parantamisessa, immunomodulatorisessa, antioksidanttisessa, anti-inflammatorisessa, virustenvastaisessa jne. tärkeimmät C. deserticolan bioaktiiviset komponentit ovat fenyylietanoidiglykosidit (PheGs, PhGs). Tähän mennessä yli 20 fenyylietanoidiglykosidia on eristetty C. deserticolan mehevästä varresta. Heidän joukossaanakteosidi ja ekinakosidiovat kaksi pääkomponenttia, joilla on merkittäviä farmakologisia vaikutuksia, ja ne on dokumentoitu C. deserticolan laatustandardeiksi Kiinan farmakopeassa (2005 ja 2010). PhG:iden kolme kemiallista komponenttia ovat orgaaninen happo, sakkaridi ja fenyylietanoli, mutta fenyylietanoidin biosynteesireittejä koskevat yksityiskohdat ovat edelleen huonosti ymmärrettyjä C. deserticolassa.
Huolimatta C. deserticolan kaupallisesta ja lääketieteellisestä merkityksestä tämän lajin genomi- ja transkriptiotiedot ovat hyvin rajalliset. NCBI-tietokannassa ei ole saatavilla EST:itä, ja tämän lajin täydelliset genomitiedot eivät ole saatavilla kloroplastin genomisekvenssiä lukuun ottamatta. Rajallinen transkriptiotieto estää PhG:n biosynteettisten mekanismien tutkimisen. RNA-seq-teknologialla voidaan luoda sekvenssejä kohteena olevan genomin ilmentyneistä osista ja tunnistaa geenejä [18] käyttämällä NGS-teknologia-alustoja (kuten Applied Biosystems SOLiD, Illumina HiSeq ja Roche 454). Siitä on tulossa yhä suositumpi transkription de novo -kokoonpanossa, koska se on kustannustehokas ja tehokas lähestymistapa korkealla resoluutiolla ja laajalla dynaamisella alueella, varsinkin kun sillä on etu tutkia vähän runsaita transkriptioita. Erilaisten etujen vuoksi RNA-seq on erityisen houkutteleva ei-malliorganismeille, joilla on rajalliset geneettiset resurssit. Kuitenkaan ei ole olemassa yksityiskohtaista tutkimusta C. deserticola -transkriptomista RNA-seq.
Tässä tutkimuksessa sekvensoimme maailmanlaajuisesti C. deserticolan varren transkription Illumina Hiseq2000 -alustan avulla ja saimme 7,9 G raakadataa. Kokoamalla ja annotaatiolla louhimme PhG:n biosynteesiin osallistuvat geenit ja geenit, jotka vastaavat koko ligniinin biosynteesistä. RNA-seq-analyysimme loi ensimmäisen C. deserticolan konsensustranskription ja tarjosi uusia oivalluksia C. deserticolan lääketieteellisen arvon kattavaan ymmärtämiseen. Lisäksi tässä kuvattua menetelmää voidaan soveltaa laajasti profiilitranskriptomiin, jotta helpotetaan sellaisten geenien löytämistä, jotka osallistuvat tiettyihin lääkekomponenttien biosynteesireitteihin toisessa lääkekasvissa, jolla on hyvin rajalliset genomiresurssit.
Materiaalit ja menetelmät
Kasvimateriaalien kokoelma
Tuore mehevä varsi C. deserticolalle louhintavaiheessa kerättiin kasvipohjasta BayanHot Cityssä Alxa Leaguessa Sisä-Mongoliassa Luoteis-Kiinassa. Keräilylupa hankittiin laitoksen omistajalta (HongKui CongRong Group). Lahjakorttinäyte talletettiin Kiinan tiedeakatemian Pekingin genomiikkainstituutin Core Genomic Facilityyn. Puhdistuksen jälkeen mehevät varren kudokset leikattiin pieniksi paloiksi ja jäädytettiin välittömästi nestetypessä ja säilytettiin sitten -80 asteessa jatkokäsittelyyn asti.
RNA:n uutto, cDNA-kirjaston rakentaminen ja Illumina-sekvensointi
Kokonais-RNA uutettiin mehevästä varresta käyttämällä TRIzol-reagenssia (Invitrogen Inc., Kalifornia, USA) valmistajan ohjeiden mukaisesti. Tuloksena saadut näytteet käsiteltiin DNaasi I:llä genomisen DNA:n poistamiseksi. Uutetut RNA:t kvantifioitiin käyttämällä Agilent 2100 bioanalysaattoria (Agilent Technologies) ja niiden eheys tarkistettiin käyttämällä denaturoivaa agaroosigeelielektroforeesia etidiumbromidivärjäyksellä. Myöhemmissä analyyseissä käytettiin RNA-näytteitä, joiden A260/A280-suhde oli välillä 1,9-2,1, RNA 28S:18S -suhde yli 1,0 ja RNA-eheysluvut (RIN:t) -8,5.
RNA-seq-kirjastot luotiin käyttämällä Illumina Truseq RNA Sample Preparation Kits -pakkauksia. Poly(A)+-RNA eristettiin kokonais-RNA:sta käyttämällä Dynal ligo(dT)25-helmiä valmistajan ohjeiden mukaisesti. Puhdistuksen jälkeen lisättiin fragmentointipuskuria mRNA:n hajottamiseksi lyhyiksi fragmenteiksi. Ensimmäisen juosteen cDNA syntetisoitiin käyttämällä näitä lyhyitä fragmentteja templaatteina yhdessä SuperScript III -käänteistranskriptaasin ja N6-satunnaisen heksameerialukkeen kanssa. Toisen juosteen cDNA syntetisoitiin sitten käyttämällä puskuria, dNTP:itä, RNaasiH:ta ja DNA-polymeraasi I:tä. Tuloksena oleva kaksijuosteinen cDNA alistettiin pään korjaukselle käyttämällä T4-DNA-polymeraasia, DNA-polymeraasi I Klenow-fragmenttia ja T4-polynukleotidikinaasia, ja ligoitiin sovittimia käyttämällä T4 DNA-ligaasia. Adaptoriligoidut fragmentit puhdistettiin käyttämällä QiaQuick PCR -uuttopakkausta ja eluoitiin EB-puskurilla. Agaroosigeelielektroforeesilla suoritetun analyysin jälkeen sopivat fragmentit valittiin templaatteiksi PCR-monistusta varten. Tuloksena olevan cDNA-kirjaston sekvensointi suoritettiin Illumina HiSeq 2000 -järjestelmällä.
Transkriptien de novo kokoonpano ja geeniekspression kvantifiointi
Sekvensoinnista saadut raakalukemat puhdistettiin poistamalla sovitinsekvenssit (ATCTCGTATGCCGTC) talon sisäisellä menetelmällä. Suoritimme sitten tiukan heikkolaatuisen suodatusprosessin. Ensinnäkin emäkset, joiden phred-laatupistemäärä on alle 20, leikattaisiin sekvenssin 3'-päästä, kunnes ne juoksevat yhteen emäkseen, jonka laatu on korkeampi (suurempi tai yhtä suuri kuin 20). Jos lukupituus on alle 50 bp, se hylätään. Toiseksi lukemat suodatetaan edelleen kriteerin mukaan, että 70 prosentilla yhden lukukerran perusteista on korkealaatuiset pisteet (suurempi tai yhtä suuri kuin 20). Kolmanneksi jatkokokoonpanoon käytettiin vain pariliitoslukuja. De novo -transkriptiokokoonpano suoritettiin Trinity-julkaisulla_20130216 [30], joka koostui kolmesta peräkkäisestä ohjelmistomoduulista: Inchworm, Chrysalis ja Butterfly. Kokoonpanoparametrit asetettiin seuraavasti: -seqType fq-JM 300G -min_contig_length 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.
Transkriptien runsauden määrittämiseksi sekvensoidut paripään lukemat kohdistettiin uudelleen koottuihin transkripteihin käyttämällä Trinityn komentosarjaa. Kartoitettuja lukuja käytettiin kvantifiointiin RSEM-ohjelmistolla (RNA-Seq by Expectation Maximization). Geenien tai isoformien runsautta edusti fragmentti per kiloemäs transkripti per miljoonaa fragmenttikartoitettu arvo (FPKM). Ne transkriptit, joiden FPKM-arvo oli yhtä suuri tai suurempi kuin 0,05, määriteltiin ekspressoituneiksi.
Ilmaistujen transkriptien toiminnallinen huomautus
C. deserticolalla ei ole geenimerkintöjä lukuun ottamatta kloroplastigenomia [1]. Merkitsimme ilmaistuja transkriptioita vertaamalla niitä Genbank Nt-, Genbank Nr- ja TAIR10_ pep_20101214_päivitettyihin tietokokonaisuuksiin erikseen käyttämällä BLAST-ohjelmaa (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.
Geeniontologia ja KEGG-polun annotaatio Sekvenssin samankaltaisuuskohdistus Uniprot-tietokantaan ( kaikkien koottujen transkriptien Gene Ontology (GO) -merkintä saatiin käyttämällä assosiaatiotiedostoa, joka on ladattu osoitteesta (ftp://ftp.ebi.ac.uk/pub/ tietokanta/GO/goa/UNIPROT/gene{0}}-yhdistys. goa_uniprot.gz). CC-, BP- ja MF-luokat erikseen.
KEGG-reittitiedot määritettiin kaikille ennustetuille proteiinisekvensseille online-työkalulla KAAS (KEGG Automatic Annotation Server) [34]. Fasta-muodossa olevat sekvenssit lähetettiin KAAS-pyyntöön, ja tuloksena saadut tiedostot kaikista C. deserticolan kantatranskriptomiin liittyvistä polkutiedoista ladattiin. Annotointiin käytettiin BBH-menetelmää (bi-directional best hit) käyttäen 13 kasvi-organismin geeniaineistoa KEGG:ssä.

LUONNOLLINEN CISTANCHE TUBULOSA CISTANCHE UUTTE PHGS75% ECH 30% ACT 12%
RT-qPCR-analyysi
DNaasi I:llä pilkkomisen jälkeen noin 5 ug kokonais-RNA:ta muunnettiin ensimmäisen juosteen cDNA:ksi käänteistranskriptioreaktion avulla oligo(dT)15-alukkeilla ja GoScript Reverse Transcription Systemillä (Promega). Sitten cDNA-tuotteet laimennettiin 10--kertaisesti nukleaasivapaalla deionisoidulla vedellä ennen käyttöä templaattina reaaliaikaisessa PCR:ssä. Spesifiset cDNA:t monistettiin GoTaq 2-Step RT-qPCR -järjestelmällä (Promega) 20 ul:n tilavuudessa. PCR-monistus suoritettiin 60 asteen pariutumislämpötilassa 7500 Real-Time PCR Detection System -järjestelmällä (Applied Biosystems) valmistajan ohjeiden mukaisesti. Suhteellinen transkriptiomäärä laskettiin vertailevalla syklin kynnysmenetelmällä käyttämällä geeniä "comp10579_c0" sisäisenä standardina käyttäen 7500 Manager -ohjelmistoa.
RT-PCR:n alukeparit suunniteltiin online-ohjelmiston (http://primer3.ut.ee/) perusteella, ja ne on lueteltu S1-tietojoukossa.
Tulokset
C. deserticolan mehevän varren RNA-sekvensointi ja de novo -transkriptiokokoonpano
C. deserticolan vartta on käytetty laajasti perinteisesti tärkeänä tonic-aineena Kiinassa ja Japanissa useiden vuosien ajan. Saadaksemme globaalin yleiskatsauksen geenin ilmentymisestä C. deserticolan mehevässä varressa keräsimme C. deserticolan varren näytteitä samasta kasvipohjasta vuosina 2013 ja 2014, vastaavasti. Kokonais-RNA:t uutettiin ja polyA+-RNA:t puhdistettiin paripäisten RNA-seq-kirjastojen rakentamiseksi. 79 433 734 ja 86 019 176 paripään lukua, jotka vastaavat lähes 8 miljardia ja 8,6 miljardia emästä sekvenssistä saatiin käyttämällä Illumina HiSeq 2000 -sekvensointia

alusta 2013-vuoden ja 2014-vuoden näytteissä (taulukko 1). Adapterisekvenssien poistamisen ja heikkolaatuisten lukujen suodattamisen jälkeen (katso yksityiskohtaiset tiedot kohdasta Methods), 64 831 040 korkealaatuista paripään lukua 2013-vuoden näytteessä käytettiin de novo -transkriptomien kokoamiseen. Käyttämällä Trinity-sekvenssin kokoajaa [30] luotiin 51 719 geeniä ja 95 787 transkriptisekvenssiä, joiden transkriptin pituus vaihteli välillä 200 bp - 15 698 bp. Koottujen transkriptien keskimääräinen pituus on 950 emästä ja N50:n pituus on 1 519 emästä. Eripituisten transkriptien lukumäärä paljasti, että 57,32 % kootuista transkripteistä oli noin 500 emäsparia tai pidempiä (kuvio 1A). Korkealaatuiset paripään lukemat 2014-vuoden näytteessä kartoitettiin koottuun transkriptiin. Lisäksi havaitsimme, että jokaisen kootun geenin transkriptimäärä vaihteli ja 69 % geeneistä, joilla oli yksi ilmentynyt isoformi, kun taas 31 % geeneistä ilmensi kahta tai useampaa transkriptia (kuvio 1B).
Ilmaisujen kvantifiointi ja koottujen transkriptien toiminnallinen huomautus
Geenien tai transkriptien runsaus määritettiin käyttämällä RSEM-pakettia, jossa sekvensoidut lukemat kohdistettiin uudelleen koottujen geenien tai transkriptien sekvensseihin käyttämällä Bowtietä, ja näitä kartoitettuja lukuja käytettiin kvantifiointiin. FPKM-arvo kullekin geenille tai transkriptille laskettiin, ja lopuksi tunnistimme 63 957 ja 52 857 aktiivisesti ekspressoitunutta transkriptia (FPKM-arvo suurempi tai yhtä suuri kuin 0,5) C. deserticolan lihaisista varren näytteistä 2{{17} }13 ja 2014. 44 776 transkriptiota (70,01 % 2013-vuosi-otoksessa, 84,71 % 2014-vuoden otoksessa) ilmaistiin yleisesti kahdessa rinnakkaisnäytteessä, ja niiden ilmentymistietojen korrelaatio (Pearson-korrelaatiokerroin: 0,91979) oli näkyy S1 kuvassa. Sekvensoinnin raakadata oli ladattu NCBI SRA -tietokantaan (liityntänumerot: SRX857402 ja SRX858938). Käytimme 2013-vuoden näytteessä tunnistettuja ilmentyneitä geenejä lisäanalyysiin. Toiminnalliset annotaatiotiedot kaikille ilmaistuille transkripteille saatiin kahdella menetelmällä. Ensinnäkin kaikki ilmennetyt transkriptit rinnastettiin tunnettuihin nukleotidi- (GenBank nt) ja peptidisekvenssitietokantoihin (GenBank nr ja Arabidopsis-peptidi) erikseen BLAST-algoritmilla. 63 957 lausunnosta,

29 220 (45,7 %) oli merkitty ja ne osoittivat homologiaa sekvenssien kanssa missä tahansa kolmesta koehenkilötietokannasta E-arvon rajalla 1e-20. Sillä välin kaikkien ekspressoitujen transkriptisekvenssien ehdokaskoodausalueet ennustettiin käyttämällä TransDecoder-ohjelmistoa, ja kunkin transkriptin pisimpiä ORF-alueita käytettiin Pfam-domeenihakuun. Tämän seurauksena 21 358 (33,4 %) transkriptiota merkittiin Pfam-tietokannan perusteella. Kaiken kaikkiaan 30 098 (47,1 %) transkriptiota sovitettiin merkittävästi tunnettuihin geeneihin julkisissa tietokannassa yhdistämällä kaksi yllä olevaa menetelmää. Täydellinen ilmaistujen transkriptien luettelo funktion annotaatioineen näytettiin lisätiedoissa (S2 Dataset).
Tutkimme 20 eniten ilmentynyttä transkriptiota (taulukko 2), jotka vastaavat 18,99 % kaikista sekvensointilukemista, ja havaitsimme, että useimmat niistä ovat geenejä, jotka reagoivat abioottiseen

stressiärsyke. Dehydriini (DHN), hydrofiilisten ja lämpöstabiilien stressiproteiinien luokka, jossa on suuri määrä varautuneita aminohappoja ja jotka kuuluvat ryhmän II Late Embryogenesis Abundant (LEA) -perheeseen, on voimakkaimmin ilmentyvä geeni. Kolme erilaista Dehyrin-transkriptia (komp28713_c0_seq1/2/4) havaittiin voimakkaasti ilmentyneinä mehevissä varsissa, jotka voivat olla osallisena solujen suojaamisessa kuivuusstressin aiheuttamilta vaurioilta. Muita stressiin liittyviä geenejä, kuten lämpöshokkiproteiinia, patogeeniin liittyvää proteiinia ja metallotioneiinia, havaittiin myös ekspressoituvan voimakkaasti, mikä saattaa liittyä sen vakavaan eloonjäämisympäristöön. Lisäksi jotkin konstitutiiviset geenit, mukaan lukien 26S ribosomaalisen RNA-geenin (komp22329_c2_seq1), auksiinin repressoituneen/dormanssiin liittyvän proteiinin (comp20999_c0_seq1), Myös ADP-ribosylaatiotekijä (comp20499_ c0_seq1) transkriptoitui voimakkaasti.

LUONNOLLINEN CISTANCHE TUBULOSA IMUNITEETTA PARANTAAN PHGS75% ECH 30% ACT 12%







