近年、GeneformerやscGPTなど、「シングルセル基盤モデル(single-cell foundation model; scFM)」と呼ばれるAIモデルが登場しています。
ChatGPTのような大規模言語モデルが大量の文章を事前学習することで、その知識をさまざまな用途に利用できるように、scFMでは大量のscRNA-seqデータを事前学習し、そこから得られた細胞や遺伝子の表現をさまざまな解析に利用することが試みられています。
なぜscFMが期待されているのか
scRNA-seqは、一つひとつの細胞の遺伝子発現を測定できる非常に強力な技術ですが、解析の難しいデータでもあります。1細胞あたりの測定量が少なくデータが非常に疎であることに加え、細胞ごとの測定深度の違いやbatch effectも大きく、さらにnormalization、次元削減、clustering、batch correctionなど、どの解析方法やパラメータを選ぶかによって得られる結果も変わります。しかも、多くの場合、どの結果が生物学的に正しいのかを判定する完全なground truthはありません。
こうしたscRNA-seqデータそのものの難しさについては、以前の記事「シングルセルRNA-Seq解析の再現性とは?データ品質と限界を解説|2019年の知見を2026年の視点で再考」で詳しく取り上げています。
こうした難しさを、大規模な事前学習によって乗り越えられるのではないかという期待があります。多数の研究から集められた膨大なscRNA-seqデータをあらかじめ学習すれば、多くの細胞に共通する遺伝子発現の構造を学習し、個々の実験に固有のノイズやbatch effectを超えて、より普遍的な生物学的特徴を捉えられるのではないか。
しかし、最近の研究を見ると、問題はそれほど単純ではないようです。
大量の細胞を学習しても、バッチエフェクトは残った
2025年にbioRxivへ投稿された「Batch Effects Remain a Fundamental Barrier to Universal Embeddings in Single-Cell Foundation Models」では、複数のシングルセル基盤モデルについて、事前学習によって得られるcell embeddingにバッチエフェクトがどの程度残っているかが検証されました。その結果、評価対象となったscFMでは、事前学習済みのembeddingにもbatch signalが残っていることが示されました。さらに、embeddingに対して単純なpost-hoc batch-centeringを行うことでalignmentが改善することも示されています。
著者らは、真にuniversalなcell embeddingを実現するには、将来のscFMに明示的なbatch-effect correction mechanismを組み込む必要があると指摘しています。この研究は現在bioRxivのプレプリントであり、査読済み論文ではありませんが、ここで提起されている問題は非常に重要です。
なぜ、これほど大量の細胞を学習しても、バッチエフェクトを取り除くことが難しいのでしょうか。これは単に、現在のAIの性能がまだ十分ではないからなのでしょうか。
そもそも「生物学的な差」と「技術的な差」を区別できるのか
ここには、バッチ補正という問題そのものが持つ根本的な難しさがあります。観測されたデータには、疾患、薬剤処理、細胞分化などによる本来調べたい生物学的な違いだけでなく、サンプル調製、測定日、試薬、装置、ライブラリ調製、シーケンス深度などによる技術的な違いも含まれています。私たちが実際に観測しているのは、それらがすべて混ざった結果です。以前の記事「RNA-Seqのバッチエフェクト補正と正規化の限界|ComBat・VST・TMM・Quantileで補正前後を比較」でも、補正によってデータを変えることはできても、それが生物学的に正しい状態になったことを意味するわけではない、という問題を取り上げました。
実際の解析が可能なのは、技術的な影響が存在しないからではなく、調べたい生物学的な違いが、それらの影響に対して相対的に十分大きく、再現性をもって捉えられる場合だと考えることができます。
ところがscRNA-seqでは、1細胞あたりの測定量が少なくデータが疎であるため、シーケンス深度などの測定条件による影響が相対的に大きくなりやすくなります。さらに、normalization、次元削減、clustering、batch correctionなど、解析アルゴリズムやパラメータの選択によっても、最終的に見えるデータの構造が大きく変わることがあります。つまり、観測したい生物学的な構造に対して、測定と解析によって生じる影響が無視できないほど大きくなりやすいことが、scRNA-seq解析を難しくしている重要な理由の一つです。
この問題を前提にすると、最近報告されているscFMのベンチマークも少し違って見えてきます。
BioLLM:大量に事前学習すればよいわけではない
2025年にPatternsに発表されたBioLLMは、設計や実装の異なる複数のsingle-cell foundation modelを共通のframeworkで利用・比較できるようにした研究です。zero-shotとfine-tuningを含む複数のタスクで比較した結果、モデルによって性能に大きな違いがあることが示されました。
scGPTは複数のタスクで比較的安定した性能を示した一方、他のモデルには異なる得意・不得意がありました。つまり、大量のsingle-cell dataを事前学習したというだけで、あらゆる下流解析に適した表現が自動的に得られるわけではありません。
これはfoundation modelが役に立たないという意味ではありません。むしろ、何千万もの細胞を学習した巨大なモデルであっても、何を残し、何を無視するべきなのかという問題から自由にはならないことを示しているのではないでしょうか。
SCMBench:「良い統合」とは何か
2026年にNature Communicationsに発表されたSCMBenchでは、single-cell multi-omics integrationについて、19のdomain-specific modelと4つのfoundation modelを含む23手法が比較されました。scGPT、Geneformer、scFoundation、UCEなどのfoundation modelに加えて、Harmony、Seurat、LIGER、scVI、scJoint、GLUEなど多数の既存手法が評価されています。重要なのは、この研究が単純に「どれだけきれいにデータを統合できたか」だけを評価していないことです。integration accuracyやbatch-effect correctionだけでなく、biomarker detectionやtrajectory inferenceなどを通じた生物学的情報の保存についても評価しています。
その結果、すべての評価軸で一貫して優れた方法があるわけではなく、データセットや評価する対象によって、優れた方法は変わりました。foundation modelも、全体としてdomain-specific modelを上回りませんでした。
さらに重要なのは、batch effectの強さを段階的に変えたsimulationから、著者らがbatch correctionとintegration accuracyの間にはfundamental trade-offがあると指摘していることです。batch effectを強く取り除けば生物学的な情報まで失う可能性があり、反対に生物学的な情報を保存しようとすればtechnical artifactが残る可能性があります。
つまり、「batch effectをできるだけ取り除けばよい」という単純な問題ではありません。何を取り除き、何を残すのかという問題そのものが、single-cell data integrationの中心にあることが、このベンチマークからも見えてきます。
SCMBenchでは、foundation modelのembeddingをscVIのframeworkに入力する方法も検討されています。つまり、「foundation modelか従来の専用アルゴリズムか」という二者択一ではなく、foundation modelによる表現学習とtask-specificな解析を組み合わせる方向も考えられています。今後、このような組み合わせが標準的な解析方法になっていく可能性もあります。
それでも「標準的な解析手順」は作られていく
ここで私たちが言いたいことは、どのアルゴリズムが最も優れているか、ということではありません。Harmonyがよいのか、scVIがよいのか、あるいは将来のfoundation modelがよいのか。それらは今後も変わっていくでしょう。
むしろ問題は、生物学的な違いと技術的な違いを完全には区別できず、「良い統合」にもtrade-offがあるにもかかわらず、研究の現場では何らかの方法を選ばなければならないことです。
研究者同士で結果を比較し、解析方法を共有するためには、ある程度の共通した手順や判断基準が必要です。そのため、ベンチマークや実務経験が蓄積されれば、「このようなデータには、この方法を使う」「この指標を確認する」「この条件を満たせば、十分に補正されたとみなす」といったコンセンサスが形成されていくでしょう。標準化には、研究成果を比較し、共同研究を進め、解析方法をMethodsとして共有するうえで大きな実務的価値があります。
それでも私たちは、「この手続きが広く受け入れられている」ということと、「この手続きによって生物学的に正しい結果が得られる」ということは、全く別の問題であるという意識を保ち続けることが大事だと考えています。
標準化が「手続き主義」に変わるとき
標準的な解析手順が確立されれば、研究者は一つひとつの判断を最初から検討しなくても解析を進められるようになります。それは標準化の大きな利点です。しかし同時に、「なぜこの補正を行うのか」「補正によって何が変わったのか」「消えた差は本当に消してよかったのか」といった問いを考えなくても、手順そのものは実行できるようになります。
ここで、標準的な手順に従うこと自体が解析の妥当性を保証するかのように扱われるようになると、解析の目的が、データから生物学的な現象を探ることから、「正しい」とされる手続きを実行することへと変わってしまう危険があります。そして、本来なら研究対象になったかもしれない現象を、問いになる前に消してしまう危険にもつながります。
標準化された解析手順が、新しい生物学的発見を阻害する要因にもなりうることは、AIが複雑な解析を短時間で簡単に実行できる時代において、特に注意すべき問題だと考えています。AIとロボティクスによって、仮説を生成し、実験によって検証する能力が飛躍的に高まっても、何を仮説として検討するのかという探索範囲まで、自動的に広がるわけではありません。 むしろ、既存の知識や標準的な解析手順によって探索範囲が狭く設定されていれば、その限られた範囲をこれまで以上の速度で探索することになりかねません。
標準的な解析の外にも、生物学はある
この問題はsingle-cellのバッチ補正に限りません。以前の記事「DEG解析で有意とならなかった遺伝子にも、実験で機能が検証されたものがある」では、通常のDEG解析では必ずしも目立たなかった遺伝子が、異なる実験データと組み合わせることで候補となり、実際の機能的検証へつながった研究を紹介しました。
標準的な解析方法は、特定の問いに答えるために設計された有用な方法です。しかし、その方法で選ばれなかったことは、生物学的に重要ではないことを意味しません。
AIによる研究の効率化が進めば、標準的な解析では見つかりにくい現象が、さらに探索されにくくなる可能性もあります。解析によって選ばれた結果が論文化され、knowledge baseとして蓄積されれば、AIはその既知情報を利用して次の仮説を作るからです。標準的な解析による選択が次の仮説を方向づけ、それをAIが高速に検証するというフィードフォワード構造によって、研究が効率化する一方で、生物学の探索範囲が狭まっていく可能性があります。この問題については「RNA-Seq解析にネットワーク解析は必要か?|意味のないネットワーク図が科学知識になるまで」でも取り上げています。
AI時代に、研究者に求められる能力とは何か
AIとロボティクスによって、解析だけでなく、仮説の生成から実験による検証まで急速に効率化していくでしょう。そうした時代には、研究者にとって「何を探索するのか」を設定する能力が、これまで以上に重要になるのではないでしょうか。
そのためには、出てきた結果をそのまま受け取るのではなく、データに何が起きているのか、解析によって何が変わったのかを調べ、結果を疑い、そこから新しい問いを見つける能力が必要です。標準的な解析から外れた結果や、予想と合わないデータの中に、これまで探索されてこなかった問いが隠れているかもしれないからです。
AIによって「答えを出す」ことが容易になるほど、何を問うのかを考えることの重要性は、むしろ高くなっていくと私たちは考えています。
もっとデータを見ましょう
では、どうすればよいのでしょうか。私たちの提案は、とても単純です。
もっとデータを見ましょう。
高度なアルゴリズムを使わない、という意味ではありません。AIを使わない、という意味でもありません。必要であれば、最新の解析手法もAIも積極的に使えばよいと思います。
しかし、最終的な解析結果だけを見るのではなく、元のデータを見る。サンプルごとの違いを見る。分布を見る。解析の前後を比較する。予想から外れたデータを見る。そして、気になる結果があれば元のデータへ戻る。技術的な差と生物学的な差を完全に区別することができないからこそ、データに何が起きているのか、そして解析によってデータに何が起こったのかを確認することが重要です。
Subio Platformは「データを見る」ための解析環境です
現在では、論文で使われる高度な解析を、GUIやAIによって簡単に実行できるようになっています。これは研究者にとって大きな進歩です。しかし、「高度な解析を実行できること」と「データを解析できること」は同じではありません。
Subio Platformは、標準的な解析をブラックボックスとして実行することよりも、データを繰り返し見ながら考えることを重視しています。PCA、クラスタリング、サンプル間の分布、個々の遺伝子の発現パターン、フィルタリングの前後などを行き来しながら、解析結果からもう一度元のデータへ戻ることができます。
そして必要であれば、R、Python、AIを使ってさらに高度な解析を行う。逆に、R、Python、AIで得られた結果からSubio Platformへ戻り、実際のデータでは何が起きているのかを別の角度から確認する。このようにツールを使い分けながら、データそのものを見続けることが重要だと私たちは考えています。
AIによってツールを使うことが容易になるほど、ツールを操作できること自体の価値は相対的に小さくなっていくでしょう。その一方で、データを観察し、解析結果を疑い、そこから新しい問いを見つけることの価値は、むしろ大きくなります。
それが、私たちがSubio Platformの基本メッセージである Master Analysis, Not the Tool. という言葉に込めている考え方です。
