Litmus — 話題のニュースを、深く読み解く。 RSS
AI

Claudeは20万件の酵素候補から実験すべき異常を見つけた

約950のClaudeエージェントがDNAデータを21時間探索し、新しい酵素系ARTを発見した。AIが候補を見つけ、人が実験で確かめた役割分担を技術報告からたどる。

研究室で多連式ピペットを使い試料を扱う白衣姿の研究者

イメージ写真 記事の内容を撮影したものではありません。Photo by Thirdman on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

「AIが新しい酵素を発見した」と聞くと、ロボットが試薬を混ぜ、顕微鏡をのぞく姿を想像するかもしれない。今回Claudeが担ったのは、実験そのものではない。膨大なDNAの文字列を読み、人が実験すべき異常へ付箋を貼る仕事だった。

Anthropicは9月23日、Claudeが新しい酵素系「ART」を見つけたと発表した。約950のAIエージェントが21時間動き、20万件を超える酵素候補から20件の報告書へ絞った。その後、人間の研究者が実験で確かめた。AIはどこで発見に届き、人は何を受け取ったのか。まず、見つかったものの形から見ていく。

新しいのは3部品の並び

Claudeが見つけたのは、酵素1個の新しい働きではなく、3種類の部品が一緒に並ぶ仕組みだった。Anthropicはこれを「array-associated reverse transcriptases」、略してARTと名付けた。

ARTは主に、細菌へ感染するウイルスであるバクテリオファージのDNAにある。技術報告が示す部品は次の3つだ。

  • RNAの情報をDNAへ写す「逆転写酵素(RT)」
  • RTのすぐ隣にある、役割がまだ分からない相棒の遺伝子
  • RTの手前に並ぶ、同じ間隔のDNA反復配列

RTそのものは以前の研究にも記録されていた。Claudeが気づいたのは、その手前に長い反復配列があり、隣に専用らしい遺伝子も並ぶことだった。Anthropicの発表によると、この組み合わせはこれまで1つの仕組みとして特徴づけられていなかった。

反復配列の見た目はCRISPRの配列を思わせる。ただし、現時点でDNAを切ったり貼ったりできると分かったわけではない。新しいのは部品1個ではなく、3つが一緒に並ぶ仕組みのまとまりだ。では、20万件を超える候補の中から、どうやってこの並びへたどり着いたのだろう。

20万件を20報告へ絞った

探索は、単独のチャットに長い質問を投げる形ではない。Claude Codeのセッションが、作業役、査読役、記録役、編集役に分かれた。全体は入力の準備、データベース探索、分類、近くの遺伝子の集計、気になる系統の深掘りという段階を進む。

技術報告の方法では、探索規模が119タスク、949のエージェントセッション、最大58並列と記録されている。使ったモデルはClaude Mythos 5で、壁時計の時間は21.5時間、消費は2億1,560万トークンだった。

段階残った対象
条件を満たしたRT配列203,381件
50%同一性でまとめたRTクラスタ198,290件
新しい系統として選んだ候補約3,500件
人が読める形にした最終報告20件

この表の面白さは、最初からARTを探す条件が用意されていなかった点にある。人が「反復配列を探せ」と指定した検索ではなく、エージェントが途中でおかしな並びに気づき、追加調査を作業キューへ入れた。

しかも最初の仮説は外れていた。あるRTが近くのファージ遺伝子と関係すると考えたものの、作業役は調査後にその関連を退けた。それでもRT自体を追う価値があると判断し、次の作業役が上流のDNAを直接読んだ。失敗した仮説を捨てても、気になった対象まで捨てなかった。ここで探索は、集計から「観察」へ切り替わる。

生のDNAを読んで反復に気づく

DNAデータは、A・T・G・Cが続く長い文字列として読める。次の作業役は、RTの手前にあるDNAを会話の文脈へそのまま読み込み、同じ短い並びが約100〜200文字おきに繰り返されることへ気づいた。技術報告のFigure 1には、その瞬間の作業記録と14個の反復が掲載されている。

発見後の手順も記録されている。

  1. 反復の数と間隔を測る
  2. 既知のRT系やCRISPRの並びと比べる
  3. 同じ特徴が文献に報告済みか検索する
  4. 別のDNAでも同じ構造があるか確かめる
  5. 根拠をまとめて人間向けの報告書を作る

自分は発表を読む前、「AIが新しいタンパク質を設計した」という話を予想していた。実際の山場はもっと地味で、もっと研究らしい。大量の文字列の中にある違和感を拾い、「既知の分類に収まらないので調べる価値がある」と判断したことだった。

固定した入力で追試すると、DNAを会話の文脈へ200文字以上読み込んだ試行ほど反復を認識しやすかった。技術報告では、ツールやファイルを増やしただけでは精度が上がらず、モデルが配列そのものを見ることが重要だったと結論づけている。では、人間の研究者はどこから仕事を引き継いだのか。

人が実験でRNAを確かめた

候補の報告後は、人間の研究者が分析と実験を指揮した。95のRTクラスタを調べ直すと、28件でRTの手前に反復配列が見つかった。配列は3〜21個の単位で構成され、各単位の間隔はほぼ一定だった。技術報告に系統と配置が示されている。

次に研究者は、過去に公開されたファージ感染実験のRNAデータを調べた。ARTの配列は感染中に盛んに読み取られ、15分後にはファージ由来RNAの最大8%を占めた。さらに大腸菌へARTの配列を入れる実験でも、反復の単位に対応する短いRNAが別々に生じた。技術報告の実験結果に記録されている。

ここまでで、DNA上の模様だけだった候補が、実際にRNAとして使われる仕組みらしいところまで進んだ。一方、RTが本当に働くこと、その短いRNAを材料にすること、相棒のタンパク質と結びつくこと、ファージの中で何をしているかはまだ示されていない。CRISPRに似た配置は、遺伝子編集の能力を意味しない。

Anthropicの発表は、実験をすべて人間の科学者が行ったと明記している。つまり今回の役割分担は、AIが仮説を大量に作って価値のある1件を人へ渡し、人が現実の試料で確かめる形だ。では、この発見の仕方は次も同じように働くのだろうか。

再現より探索範囲が広がる

同じ探索をもう一度走らせれば、毎回ARTへ到達するわけではなかった。研究チームは全探索をさらに10回実行したが、ARTの候補自体を拾った回はあっても、上流のDNAを直接読むところまで進まず、反復配列は再発見されなかった。技術報告は、広い探索空間とエージェントの非決定的な動きを理由に挙げている。

これはボタンを押せば同じ発見が出る装置ではない。それでも、従来は研究者が何週間から何か月もかけて行う候補整理を、21.5時間で20件の報告へできた。価値は答えを確定することより、研究者が見られる範囲を広げることにある。

大量に出る仮説のうち、どれを実験へ回すか。その判断を研究者が見直し、次の指示へ戻す。Anthropicはこの循環を「科学者の好み」をAIへ教える作業として説明している。自分には、AIが科学者を置き換えた話より、科学者が観察に使える目を何百組も増やした話として腑に落ちた。

まとめ

Claude Mythos 5を使った949のエージェントセッションは、20万件を超える逆転写酵素の候補を調べ、最終的に20件の報告へ絞った。その途中で1つのエージェントが生のDNAを読み、RT、相棒の遺伝子、反復配列からなるARTを見つけた。

人間の研究者は、その候補を再解析し、反復配列から短いRNAが作られることを実験で確かめた。ARTの本来の働きはこれからの研究課題だ。それでも今回、AIが異常を見つけて仮説と根拠を報告し、人が現実の試料で検証するところまで、研究の受け渡し方が具体的に示された。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →