GO解析・Pathway解析で原因はわかるのか?|RNA-Seqの標準的な解析手順の限界と使い分け

RNA-Seq解析では、発現変動遺伝子(DEG)を抽出したあと、GO解析やPathway解析を行うことが標準的な流れとして広く使われています。実際、GO解析やPathway解析は、大量の遺伝子発現変化をまとめて解釈するための便利な方法です。個々の遺伝子を一つずつ眺めるだけでは分かりにくかった、細胞周期、炎症応答、代謝、細胞死などのまとまった変化を捉えることができます。

しかし、本来は研究目的によって、次に必要な解析は異なるはずです。病態で何が大きく変化しているのかを知りたい場合、細胞の状態を特徴づける遺伝子群やbiomarker候補を探したい場合、研究対象の現象を引き起こした原因に近い因子を探したい場合では、同じ解析を行えばよいとは限りません。それにもかかわらず、RNA-Seq → DEG → GO解析 → Pathway解析という流れそのものが、「RNA-Seq解析で行うべき手順」として受け取られることがあります。

以前の記事「RNA-Seqデータの解析手法は、これまで偏りすぎていたのではないか?|DEG以外の見方の可能性」でも、標準的な解析方法によって、私たちがデータのどこを見るかが方向づけられる可能性について取り上げました。この記事では、RNA-SeqでDEGを抽出した後に行われる一般的なGO解析やPathway解析を中心に、それらがどのような研究目的に向いているのかを考えてみます。

もしオミクスデータから原因を見つける方法が分かっているなら

少し考えてみましょう。もしRNA-Seqをはじめとするオミクスデータから、研究対象の現象を引き起こした原因に近い上流因子を高い確率で特定する解析方法がすでに確立しているのであれば、分子生物学の研究はこの十数年でもっと大きく変わっていたはずです。

RNA-Seqをはじめとするオミクス解析は、すでに非常に多くの研究で利用されています。計算手法もデータベースも大きく発展し、GO解析やPathway解析を含むさまざまな解析を比較的容易に実行できるようになりました。それでも、原因に近い候補を絞り込むこと自体は依然として研究の大きな課題で、研究者はさまざまなデータや知見を組み合わせながら候補を探しています。

オミクスデータから「何が変化しているか」を見つけることと、「なぜその現象が起きたのか」を特定することは、そもそも全く違うことです。その前提に立って、解析手法を見直してみてはいかがでしょうか。

では、RNA-Seq解析で標準的に行われているGO解析やPathway解析は、実際には何を見ているのでしょうか。

GO解析は何を調べているのか

典型的なGO enrichment analysisでは、入力した遺伝子群に特定のGO termが期待より多く含まれているかを調べます。

たとえば、発現が上昇した100個の遺伝子の中に「DNA repair」にannotateされた遺伝子がbackgroundと比較して多ければ、DNA repairに関連するGO termがenrichmentされます。つまり、GO解析が直接答えているのは、「この遺伝子群には、どのような既知の機能が偏って含まれているか」という問いです。「この現象を何が引き起こしたのか」を逆算しているわけではありません。

一般的なPathway enrichmentも基本的には同様です。発現変化した遺伝子群と既知のPathwayとの対応関係を利用して、観測された変化を生物学的な単位で整理します。

下流の大きな変化は見つけやすい

細胞内では、ある上流の変化が、多数の遺伝子の発現変化を引き起こすことがあります。たとえば、上流のシグナルによって転写因子などの活性が変化し、その結果として多数のtarget geneの発現が変わり、最終的に細胞機能やphenotypeが変化する、という流れです。

RNA-Seqで見つけやすいのは、この中でも多数の遺伝子がまとまって変化する部分です。一方、現象の原因に近い因子そのものは、mRNA量が大きく変化するとは限りません。受容体へのligand binding、タンパク質のリン酸化、酵素活性、核移行、タンパク質間相互作用などによって機能が変化する場合、その分子のRNA量にはほとんど変化が見えないこともあります。

そのため、RNA-Seqから通常のGO解析やPathway解析を行うと、現象を引き起こした原因そのものより、その結果として生じた大きな下流応答の方が目立ちやすいと考えられます。細胞や組織で何が大きく変化しているのかを整理したり、病態や処理条件を特徴づけるgene signatureを探したりする目的には、このような性質は適しています。一方で、原因に近い上流因子を探すことが目的であれば、同じ解析が得意な問いとは一致しません。

GO解析やPathway解析は、RNA-Seqを行ったら必ず実行する標準工程というよりも、研究目的に応じて選ぶ解析の一つとして考える方が自然です。

Pathway図の「上流」は、現象の原因に近いという意味ではありません

Pathway図では、receptor、kinase、transcription factor、target geneのように、既知のシグナル伝達関係に沿って分子が配置されます。しかし、Pathway図の「上流」は、現象の原因に近いという意味ではありません。

当然ながら、あるPathwayがenrichmentされたとしても、そのPathwayの上流に描かれているreceptorが、研究対象の現象を引き起こしたとは限りません。研究対象の現象の原因という意味での上流因子が、Pathway図では中流や下流に位置していても、何も不思議ではありません。 GO解析にしろPathway解析にしろ、experiment-specificな因果関係まで判定する解析ではないのです。

GO解析・Pathway解析は、既存知識を使った解析である

GO解析やPathway解析は、データだけから新しい生物学的機能を発見しているわけではありません。観測されたデータを、これまでに蓄積された生物学的知識の枠組みに当てはめて解釈する解析です。GO annotationは、過去の実験、文献、database、computational inferenceなどに基づいて作られています。Pathway databaseも同様に、それまでに蓄積された知識を整理したものです。したがって、その結果には、これまで何が研究されてきたかが反映されます。

研究資源が多く投入されてきた分野や、少数のよく研究された遺伝子にannotationが集中する一方で、十分に研究されていない遺伝子や現象ほど、利用できるannotationは少なくなります。これは、生物学的重要性の違いではなく、これまでに蓄積された知識量の違いです。

さらに、知識が蓄積される過程で、その関係が観察された生物学的な文脈が単純化されるという問題もあります。たとえば、ある細胞種や特定の条件で確認された「A → B」という関係が、別の細胞種や条件でも同じように成立するとは限りません。それでも、GOやPathwayでは一つの一般的な機能や関係として扱われることがあります。既存のpathway knowledge baseにcondition、tissue、cellなどのcontext-specificな情報が十分に表現されていないことは、以前からPathway解析の課題として指摘されています。

加えて、既存知識の元になった研究やデータ解析そのものが、常に同じ信頼性を持つわけでもありません。実際、functional enrichment analysisを扱った186報の論文を調べた研究では、不適切なbackground gene setの使用またはその記載不足、multiple testing correctionの不足、解析条件の記載不足などが多数報告されています。つまり、GOやPathwayで利用される既存知識には、研究量やcontextの偏りだけでなく、その知識が作られた過程での解析品質のばらつきも含まれています。

つまり、GO解析やPathway解析で使われる知識体系には、何が十分に研究されてきたかという偏り、関係が成立するcontextの単純化、元になった研究や解析の品質のばらつきという限界があります。
さらに、研究対象が新規の事象であれば、当然ながら既存のGOやPathwayにはまだ記述されていません。

GO解析・Pathway解析は、何に向いているのか

GO解析やPathway解析は、数百、数千の遺伝子発現変化を、既知の機能や生物学的processの単位にまとめて解釈するのに向いています。病態でどのようなprocessが大きく変化しているのか、薬剤処理によってどのようなresponseが生じているのか、二つの条件で異なる細胞状態を特徴づける機能は何か、biomarkerやgene signatureにどのような機能的特徴があるのか、といった問いには適しています。

一方で、何が研究対象の現象を引き起こしたのか、原因に近い上流因子は何か、既存のGOやPathwayにまだ記述されていない新しい生物学的関係は何か、といった問いには必ずしも適していません。RNA-Seqを行ったら標準的に実行する手順としてではなく、研究目的に応じて選ぶ解析の一つとして考えるべきでしょう。

上流の原因を知るには、どうすればよいのか

現時点で、研究対象の現象を引き起こした原因に近い上流を、オミクスデータから確実に見つける一般的な方法はありません。RNA-Seqだけで考えるよりも、protein、phosphorylation、chromatin、metabolomeなど、異なる種類のomics dataを組み合わせて見る方が有望だと考えられます。

実際に、ChIP-seqの実験データを利用してRNA-Seqで観察された発現変化の上流TF候補を探す方法や、multi-omicsとnetwork analysisを組み合わせてDEGでは見つけにくい候補を探す方法も考えられます。ただし、これらも、「どうすれば原因、あるいはそれに近い因子を見つけられるか」という問いに対する一つの可能性にすぎず、一般的な答えではありません。

もしも原因を調べることが目的であれば、「この解析をすれば答えが出る」という標準的な手順に頼ることはできません。 何を調べれば原因に近づけるのかは、それぞれの研究対象の現象に応じて、研究者自身が考えなければならない問題です。

AI時代にも、初心者は標準手順から学ぶべきなのか

少し前までは、研究目的に合った解析手法を探し、その原理やアルゴリズムを理解し、実際に動かすところまで自分で進めることは簡単ではありませんでした。そのため、まず標準的な解析手順を覚え、そこから少しずつ応用していくという学び方には大きな意味がありました。

しかし現在では、解析手法を探すことも、その原理やアルゴリズムを調べることも、AIのサポートを受けながら進められます。RやPythonのコードを書き、エラーの原因を調べ、実行上の問題を解決するところまで、以前よりはるかに容易になりました。そうであれば、初心者だからといって、最初から「DEG → GO解析 → Pathway解析」という標準手順を覚えることを入口にする必要があるのでしょうか。むしろ最初に考えるべきなのは、自分の研究で何を知りたいのかではないでしょうか。

このようなAI時代のRNA-Seqデータ解析の学び方については、「AI時代にRNA-Seqデータ解析をどう学ぶか|操作から判断・検証へ」でも詳しく取り上げています。

RNA-Seq解析では、DEG、GO解析、Pathway解析という流れが標準的に使われています。しかし、研究目的が違えば、選ぶべき解析手法は違っていて当然です。むしろ、標準的な手法に従うことで、そのデータから見つけられる可能性を狭めていることがあると意識した方がよいのではないでしょうか。

この問題については、「AI時代のデータ解析|標準的な解析手順は、生物学的に正しいのか?」でも、標準化された解析手順が私たちの探索範囲を方向づける可能性という観点から考えています。

まずAIに、

「こういうことを知りたいんだけど、どんな解析手法が有用そうか調べて」

と聞いてみてください。

ただし、AIの最初の答えを鵜呑みにしてはいけません。

必ず、

「その手法の限界は何か」
「どのような条件で適用できるのか」

も確認してください。

Wrong Dress Code Alien Party