Metabolische RNA-Kennzeichnung / Nukleotid-Konversion RNA-Sequenzierung
Die Einzelzell-RNA-Sequenzierung (scRNA-seq) hat unsere Sicht auf die RNA-Biologie in einzelnen Zellen revolutioniert.
Aktuelle Ansätze ermöglichen es, die Gesamt-RNA-Expression für Tausende von Genen in Zehn- oder sogar Hunderttausenden von Zellen zu messen. scRNA-seq hat jedoch eine inhärente Einschränkung: Jede Zelle kann nur einmal gemessen werden.
Dies hat mehrere Folgen:
(i) Reaktionen auf Störungen können nicht direkt gemessen werden, (ii) die Kinetik der Transkription (z.B. Bursts) kann nicht untersucht werden, (iii) kurzfristige Veränderungen aufgrund einer Störung oder eines Reizes innerhalb weniger Stunden werden durch bereits bestehende RNA unterschätzt und (iv) Veränderungen in der RNA-Synthese und -Abbau können nicht unterschieden werden.
Wir haben metabolische RNA-Markierung, biochemische Nukleosidkonvertierung und scRNA-seq kombiniert (scSLAM-seq (externer Link, öffnet neues Fenster)), um die transkriptionelle Aktivität in Einzelzellen direkt zu erfassen. Der Schlüssel dazu war ein neue bioinformatische Methode (GRAND-SLAM), (externer Link, öffnet neues Fenster) den wir kürzlich entwickelt haben und die es uns ermöglichte, das Neu-Zu-Gesamt-Verhältnis (NTR) für Tausende von Genen in einzelnen Zellen genau zu quantifizieren. Wir nutzten diese Methoden, um Veränderungen der Transkription bei immunrelevanten Prozessen (z.B. Virusinfektion) zu untersuchen. Außerdem entwickeln wir unsere computergestützten Werkzeuge und Methoden (grandR (externer Link, öffnet neues Fenster), grandRescue (externer Link, öffnet neues Fenster)) weiter.
Workflow von scSLAM-seq und GRAND-SLAM
Workflow von scSLAM-seq und GRAND-SLAM. 4sU wird in neue RNA integriert und chemisch in ein Cytosinanalogon nach Zelllyse oder in fixierten Zellen umgewandelt. Die daraus resultierenden Mismatches (T zu C) in den reads von scRNA-seq ermöglichen es, das “neu-zu-gesamt” RNA (NTR)-Verhältnis pro Gen/Zell mithilfe statistischer Modellierung abzuschätzen. Die Unterscheidung alter und neuer RNA ermöglicht Genregulationsnetzwerkinferenz, funktionelle Genomansätze und die direkte Analyse des transkriptionellen Burstens.
Ribo-seq
Ribosome profiling (oder Ribo-seq) ist eine Technik zur Identifizierung und Quantifizierung der Translation von ORFs mit Subcodon-Auflösung.
Es basiert auf der Sequenzierung sogenannter ribosome footprint. Dabei handelt es sich um die RNA-Fragmente, die durch das Ribosom vor enzymatischem Verdau beim Herstellen der Proben geschützt sind. Aufgrund der verwendeten stringenten RNase-Bedingungen und der Tatsache, dass Ribosomen von Codon zu Codon springen, zeigen die Positionen der Sequenzierung eine charakteristische Periodizität in Bezug auf den Übersetzungsrahmen. Für viele sequenzierten reads befindet sich das P-Site-Codon für das entsprechende Ribosom an Position 12.
Dieses Verfahren der Zuordnung von reads zu P-Site-Codons ist jedoch zu ungenau, um viele ORFs, insbesondere die meisten kurzen Upstream-ORFs (uORFs), ordnungsgemäß aufzulösen. Wir haben die Probabilistic inference of codon activities by an EM algorithm (PRICE (externer Link, öffnet neues Fenster)) entwickelt, einen neuen Algorithmus zur Schätzung von P-Site-Codon-Positionen mit drastisch verbessertem Signal-Rausch-Verhältnis. Darüber hinaus ermöglicht uns ein neuer statistischer Test, den wir für PRICE entwickelt haben, komplexe Fälle wie mehrere überlappende ORFs zuverlässig zu lösen.
Die Validierung neu identifizierter ORFs war lange ein ungelöstes Problem. Peptide, die von kurzen ORFs translatiert werden, sind häufig in Massenspektrometriedaten nicht detektierbar. Wir enwickelten die Hypotheses, dass sie in MHC-I-Komplexen gut vertreten sein sollten, da die Peptidpräsentation über diesen Weg von Translationsraten und nicht von der Proteinmenge abhängt. In der Tat fanden wir Hunderte von kryptischen Peptiden, die aus kurzen ORFs in MHC-I-Ligandomexperimenten abgeleitet wurden.
PRICE
Links: Vergleich von Ansätzen für die Zuordnung von Lesevorgängen zu Codons in Bezug auf Signal (Gesamtzahl der im Rahmen abgebildeten Lesevorgänge) und Signal-Rausch-Verhältnis (Lärm: liest out-of-frame-zu kommentierte ORFs). Farbcodiert nach dem Schlüssel, um eine deterministische Zuordnung von Leseklassen anzuzeigen, die durch Länge und 5' Fehlanpassungszustand und Kombinationen von Leseklassen definiert sind (grundlegende, ignorierende 5'-Mismatches; erweitert, unter Berücksichtigung von 5'-Missverhältnissen; Top 4, Kombination der besten Leseklassen) und probabilistischen Zuordnungen nach PREIS.
Rechts: Gesamtmenge der Peptide, die in Proteom- und MHC-I-Peptidom-Massenspektrometrieexperimenten nachgewiesen wurden. Die 1% Peptid-Identifikation FDR ist durch eine gestrichelte Linie angezeigt. Graue Balken stellen die Peptide von ORFs dar, die auch durch ORF-RATER oder Rp-Bp (für PREIS) oder ORFs identifiziert wurden, die auch durch PRICE (für ORF-RATER und Rp-Bp) identifiziert wurden.
Integrative Analysen & Data Science
Viele Probleme in der Biologie können nur durch die Verwendung und Kombination von mehr als einem Datensatz aus großen Experimenten gelöst werden.
Herpesvirale Genome sind relativ groß (z.B. ca. 150kb für HSV-1) und sind dafür bekannt, viele Proteine (z.B. 80 bekannte Proteine für HSV-1) zu kodieren. Seit der Verfügbarkeit von Genomsequenzen basierte die Identifizierung von Genen und Proteinen auf der Vorhersage von offenen Leserahmen (ORFs), die dann in den 1990er Jahren umfassend validiert und charakterisiert wurden. Moderne Hochdurchsatztechniken ermöglichen jedoch nun einen unvoreingenommeneren Ansatz, um genetische Elemente in solchen kleinen Genomen umfassend und genau zu identifizieren. Durch die Verwendung einer großen Auswahl an verschiedenen Datensätzen konnten wir die bisherige Anmerkung von HSV-1 (externer Link, öffnet neues Fenster) auf insgesamt 201 mRNAs und 284 ORFs erweitern (externer Link, öffnet neues Fenster). Es gab zwei sehr wichtige Lektionen zu lernen: Erstens könnte eine Entdeckung aus einem einzigen großformatigen Datensatz nur ein experimentelles Artefakt darstellen. Der Schlüssel, um genau zu sein, ist, mehr als eine experimentelle Technik zu integrieren. Und zweitens, um die Translation wirklich zu verstehen und welche Proteine hergestellt werden, ist das Wissen der mRNAs (und Transkriptionsstartstellen) unerlässlich.
Integrative Analyse
Überblick über die angewandten Omics-Ansätze zur erneuten Annotierung von HSV-1. Die virale Genexpression wurde in primären humanen Fibroblasten (HFF) analysiert. Die Gesamtdaten der RNA-seq, 4sU-seq und Ribosomenprofilierung wurden kürzlich veröffentlicht. Um die Transkriptionsstartstelle (TiSS) umfassend zu identifizieren, führten wir cRNA-seq und dRNA-seq sowie RNA-seq auf subzellulären RNA-Fraktionen aus Mock-, Wildtyp- und dICP27-infizierten Zellen durch. Darüber hinaus haben wir kürzlich veröffentlichte PacBio- und MinION-Sequenzierungsdaten neu analysiert. Das Profiling der Translation Start Site (TaSS) wurde durch Ribosomenprofilierung nach Behandlung von Zellen für 30 min entweder mit Harringtonin oder Lactimidomycin durchgeführt. Die Proteomanalyse umfasste zwei ganze Proteomdatensätze mithilfe von SILAC und eine etikettenfreie Massenspektrometrie. Die verfügbaren Zeitpunkte und Bedingungen werden durch Sterne angezeigt.
Produkte von kurzen offenen Leserahmen werden nach der Übersetzung häufig schnell abgebaut. Daher haben sie die Chance, in den MHC-I Peptidpräsentationsweg einzutreten (siehe oben). Um die große Anzahl der verfügbaren Immunipeptidome-Datensätze analyieren zu können, ohne Sequenzdatenbanken auf der Grundlage von Ribo-seq-Daten aufbauen zu müssen, haben wir den computergestützten Ansatz PProteogenomic Identification using Stratified Mixture models (Peptide-PRISM) entwickelt. Peptid-PRISM identifizierte Tausende von kryptischen Peptiden und zeigte, dass kryptische Peptide tatsächlich bis zu 15% der MHC-I-Liganden in verschiedenen Tumorproben beitragen.
Peptid-PRISM identifiziert kryptische Peptide in einer Melanomprobe
Peptid-PRISM identifiziert kryptische Peptide in einer Melanomprobe (A) Workflow von Peptide-PRISM. (B) Anzahl der für Probe MM15 identifizierten Peptide. Andromeda repräsentiert die ursprünglich veröffentlichten Zahlen, klassische FDR und Peptide-PRISM sind in den Methoden (C) beschrieben. Neuartige und kryptische Peptide bestehen aus dem gleichen Prozentsatz der von NetMHCpan 4.0 vorhergesagten HLA-I-Binder wie das veröffentlichte Peptid-Set. Neuartige Peptide sind proteombasierte Peptide, die durch unseren Ansatz identifiziert werden, aber nicht im ursprünglichen Bericht. Fehlerbalken stellen 95% Binomialkonfidenzintervalle dar.