2016年1月26日火曜日

Biomatters ニュージーランドのNGS解析ソフト会社 安くても高機能

私のことを個人的に知っている方なら、以前、NGS解析ソフトといえばCLC-Bio!みたいなことを言っていたのをご存知でしょう。

CLC-BioのGenomics Workbenchは確かに、良くできたソフトです。
NGS解析ひと通りのことはできる。
マルチプルアライメントやBLASTなど、普通の配列解析もできる。
プラグインを使えば(有償、無償いろいろある)、解析の幅も広がる。
サポートをやっていたので贔屓にしていましたが、お客さんから言われた欠点らしきものといえば、価格が高いこと。
確かアカデミックで、70万円以上+年間アップデート費

限られた研究費で、実験にお金をかけるのはともかく、ソフトウェアにはできればあまりお金をかけたく無い、というのも良く耳にしました。
だから無料トライアル期間を利用して解析を一気にやってしまおう!という考えの方もいらっしゃった。
その気持ち、わかります。

でも、もっと安いソフトがあれば、使用制限無しに使い倒せば良い。

CLC-Bio社の創設者がかつてオックスフォード大学に在籍していたとき、同じ大学のもうひとりの研究者も、配列解析のソフト会社を作りたいと考えていました。
そして、ひとりはデンマークでCLC-Bio社を立ち上げ、もうひとりはニュージーランドでBiomatters社を作った。
お互い、配列解析ソフトウェア専門の会社。
コンセプトは若干違うものの、ふたりとも、「バイオインフォマティシャンではないウェット研究者でも使えるソフトウェア」を、世界中に普及させた。

日本でCLC(現キアゲン)の方が知名度が高かったのは、いち早く代理店制を取り入れたから。私も結構あちこちで宣伝しました。ええ。

Biomattersは遅れながらも昨年ようやく、トミーデジタルバイオロジー(株)と代理店契約を結んだ。
ということで私のPCには現在、BiomattersのNGSソフトウェア「Geneious」が入っています。
正直、使いやすさは良いです。
一般的な配列解析(NGS以外)は一通り揃っています。
NGS関連だと、アセンブリ、マッピング、変異解析、16S解析(パイチャート作成まで)、などなどはOKです。
ChIP-Seqはできない。

GUIはまあまあ。すごくかっこ良いというわけでは無いけれど、ダサくも無いかな。
一番の売りは、低価格ということと、無料のプラグインが多いこと。

低価格というのは、他のソフトと比べて、という条件付き。
ざっくり、Genomics Workbenchの半額以下です。

あとは、3月25日まで、2本買うと1本無料で付いてくるキャンペーンやってます(アカデミック価格で税抜き)。
ソフトウェア3本買って30万円未満!
ということは1本10万円!
ね、安いでしょ。これならもう、トライアル期間で解析しちゃえ!なんて思わないでしょ?(笑)
もちろん、トライアル期間も無くは無いです。



このソフトは買取りです。
2年目からは、アップデートフィーがかかります。

さらに、もしあなたが学生さんなら、1本、78,840円で買うこともできます!
安いでしょ? 詳しくはこちら下のほうをチェック。

安くても、機能はかなり充実しているソフトウェアです。それは保証します。
世界のシェアも実は1位かもしれない。ですよ。


こちらのイベント、「第二回PacBio現場の会」もよろしく
Geneiousの質問もあればこのときにどうぞ

2016年1月13日水曜日

マクロジェンが超高速NGS解析サーバ「Dragen」を採用!

またまたPAGからのニュースです。
あの韓国のマクロジェン社が、”大規模ゲノム解析と臨床シーケンス解析サービス向けにビッグデータのプロセシング・解析機能を強化するため”、NGS解析サーバにDragenを採用したとのこと!
詳細はこちら

Dragenといえば、前回も3回にわたって紹介しました、超高速NGS解析サーバです。

このサーバが韓国の大手ライフサイエンス企業に採用されたということは、それだけ信頼があるということ。

超高速なのは間違い無いです。
例えば、HiSeq2000のペアエンドデータの解析の場合、FastqのマッピングからVCFまで、30~100カバレッジ程度であれば、長く見積っても1時間もかかりません。
カタログなどで30xが20分、とありますが、あながちチャンピオンデータでも無いです。

BCLからFastqへのConvertについても、HiSeqの1レーン程度のデータ量であれば数分。
ちょっとあいまいな言い方ですが、データ量によります。でも10分程度と見ていれば大丈夫です。

さて、ここまで速いと、信じられないと思います。
やっぱり実機を見たいですよね。

用意しました!

順調に行けば、2月23日(火)の、「第二回PacBio現場の会」ワークショップ@秋葉原、でお披露目できるはずです。

見たいかた、速さを実感したいかた、は、PacBioに関係なくても是非この機会にワークショップにご参加下さい。
もちろん無料セミナーです。

参加はこちらからご登録下さい。

「第二回 PacBio現場の会」ワークショップセミナー [PBWS]
2/23 (火) 参加無料 10:15-17:30(9:45受付開始。終了時間は若干変更の場合あり)

プログラムは、姉妹サイト「パックマンの挑戦」で2月上旬にアップデートする予定です。

MiniSeq !? MiSeqの立ち位置は?


前回、学会の期間中は新製品の発表が良くある、って書きましたが、なんとイルミナから出ました。
その名もMiniSeq

ぱっと見、NextSeqに似ていますが、サイズはMiSeqよりも小さいようです。
そして使い勝手が良くなったとのこと。
スペック的にはMiSeq v2とあまり変わらない。
Specification Sheetから抜粋

High outputモードでのスループット
  • 2x150bpが、24時間でアウトプット6.6~7.5 Gb
  • 2x75bpが、13時間でアウトプット3.3~3.75 Gb
  • 1x75bpが、7時間でアウトプット1.65~1.875 Gb

Med-Outputモードでのスループット

  • 2x150bpが、17時間でアウトプット2.1~2.4 Gb


今はまだリサーチオンリー機器なので、そのうち、MiSeq Dxのように、MiniSeq Dxなんてのが出てくるんでしょうね。
そうするとMiSeqの立ち位置は?




2016年1月11日月曜日

企業買収は学会中に多い説

イルミナ社がCancer Testingのスピンオフベンチャー、GRAILを発表
Bill GatesやJeff Bezosも出資しているというから、注目されることは間違いない!
イルミナ社といえば、確か昨年も1月に、新製品HiSeq4000 を発表したと思います。

外資系企業は大抵1月に、大きな組織変更がある。
それに合わせて新たなビジネスモデルや新製品の発表をすることは、さほど珍しくはないでしょう。

偶然かもしれませんが、大きな学会に合わせて発表するケースもあります。

今がPAG(Plant Animal Genomics学会@サンディエゴ)ですので、イルミナ社の新たなスタートアップの話もそうでしょう。
もうひとつ、サーモフィッシャー社によるアフィメトリクス社の買収も先日ありましたね。

サーモフィッシャーと言えば、2013年のライフテクノロジーズ社の買収発表も、シンガポールで行なわれていたHuman Genome Meetingの2日目でした。
同じく2013年秋のAmerican Society of Human Genetics学会では、最終日、キアゲン社によるCLC-Bio買収の発表もありました。

2014年、2015年はちゃんと時期を覚えていないのですが、ロッシュ社、イルミナ社などによる大型買収はたくさんありました。

学会はたくさんあるので偶然と言えば偶然でしょうが、大きな学会の直前には新製品や新サービス、会社買収の発表があるように思います。

ということで、次回の注目は、
AGBT 2月中旬
ICHG 4月上旬

さて、次はどの会社がどんな新製品を出してくるのでしょうか!
楽しみですね。


2015年9月23日水曜日

超高速でNGS解析 DRAGEN(3)

皆さんはHudsonAlphaという研究機関をご存知でしょうか?
え? 知ってて常識?
私もそんなに詳しくは知らないし、知り合いもいないのですが、色んな意味ですごいところだそうです。
2008年にアメリカ・アラバマ州に設立された、非営利のバイテク専門研究機関。
現在のプレジデントは、スタンフォード大学・Human Genome Centerの部長だった、Richard M. Myers博士。
そこのシークエンスセンターには、HiSeq Xが8台、HiSeq2500が7台、HiSeq2000が5台、MiSeqが少々、それとNextSeqがあるそうです。
まさに、イルミナオールスターズ!
これらの機械を動かし、データを処理している職員が何と、たった10人(うち1人は事務)!
ここは受託機関のようなところなので、顧客は全世界に約700箇所あり、製薬会社やバイオテック企業が含まれているとのこと。
クリニカルシーケンスのブームもあってか、今年は15,200~15,500ゲノムを読むことになるだろうと予測しているらしい。

さて、そんなところで解析はどうやっているのかというと、超高速ゲノム解析パイプライン、DRAGENを使用しているとのこと。

記事の原文はここ
この中に、DRAGENをカードと表現しているところがあります。
そしてこんなくだりも
 “As it comes from Edico, it’s just an appliance,” Levy notes. “It doesn’t have any front end in front of it that actually feeds it. It’s like if you thought you were buying a car, but the car manufacturer delivered you an engine.”
(Levyさんはこのシークエンスセンターのひとです)
つまり、このときは、DRAGENのボードだけを販売していたので、「車(サーバ)買ったのにエンジン(ボード)が送られてきたようなもの」と表現しているのです。

私もそのころ(今年上半期まで)を知っているのですが、ボードだけを売るのは無理がある。
これはアメリカでもそうだったのでしょう。
今は、サーバにボードを組み込んで、サーバごと販売する方式に変わりました。
日本でもサーバセットで販売します。

HudsonAlphaでは、このGenomic Service Laboratoryのほかにも、患者さんの全ゲノムシークエンスをしている、CLIA認定のClinical Services Laboratoryにて、DRAGENが導入されているそうです。
ヒトゲノム30xの、FASTQ→VCFまでが28分でできる。
これは結構、解析スピードにインパクトを与えるのではないでしょうか?

さて、日本でも、いよいよ超高速ゲノム解析が必要となる時代が来ます。

前回に引き続き、
価格とかトライアルとかについて知りたい! という方は是非、ご連絡下さい。
まだ弊社のホームページは準備されていないので、私宛のメール宛てにお願いします。

ken_osakiあdigital-biology.co.jp 「あ」を@に変えて下さい

トライアルは無料ですよ!
速さ、精度、まずはやってみるに限ります。
お問い合わせはお気軽に。



2015年9月8日火曜日

超高速でNGS解析 DRAGEN(2)

DRAGENという製品は、アメリカ・サンディエゴに本社を置く、Edico Genome Inc.という会社が開発しました。
この会社、2014年のThe Scientist Top 10 Innovations の1位に輝いたベンチャーです。




DRAGENサーバの速さの秘密は、FPGAにあります。
ん? なんのこっちゃ?

FPGAとは、field-programmable gate array
直訳すると、「現場でプログラム書き換えできる集積回路」
「現場」って何?
簡単に言うと、「後でハードウェアを書き換えることが可能な集積回路」

ICやLSI(大規模集積回路)は後で書き換えができない集積回路ですが、一般に半導体というとこれらを連想する方が多いのではないでしょうか?
私も小学生の頃、欲しかったパソコン(結局高価すぎて買えませんでしたが)の雑誌を読んでいて、ICとかLSIとかの名前を知った記憶があります。
トランジスタがたくさん集まって小型化したのがIC、さらにたくさんのIC回路を集積して、高度な計算に使用されるのがLSI、そんな説明だったと思います。
配線が固定なのは当たり前なので、後で回路をプログラムで書き換えることができるチップがあるなんて、知らなかった、というかたもいるでしょう。

LSIなどとは別に、ハードを作った後に、回路を自由に書き換えできるのがFPGAです。
歴史的には1970年代からPLD(Programmable Logic Device)というものがあったそうで、主に製品開発途中で回路を書き換えするのに広く使われていたそうです。
今では、製品を出荷した後でも、回路の書き換え(バージョンアップなど)ができるように、書き換え可能な集積回路が多く使われているとのこと。
このサイトに歴史から原理・応用まで詳しく説明されています。 
開発者向けではありますが、こういうサイトもFPGAに詳しいです。

私はこの辺、全然素人なので、FPGAについてはこれくらいにしておきます。
ま、要するに、DRAGENサーバとは、「FPGAを使ってNGS解析専用に回路を書き換え、また後で書き換えも可能にした大規模集積回路と、専用に作られたソフトウェアが乗っかった、NGS解析サーバ」
です。


EdicoGenome社が提供するDRAGENボード
これがDRAGENボードです。

真ん中にあるDRAGENと書かれたプロセッサが、書き換え可能なFPGAプロセッサ。
両サイドにある4枚のメモリに、リファレンス配列をハッシュ化して記憶します。
プログラムがハードウェアに直接書かれているので、通常9時間かかる解析が、たった20分で終わる、というふうに超高速に解析を行なうことができるのです。

ゲノムパイプライン(リシークエンス&変異解析)の場合、マッピングはbwaと同じ、smith-watermanアルゴリズムを使用、変異解析はGATK-HCと同じ、隠れマルコフモデルを使用。
詳細は間もなく論文で明らかになるはずです。

海外では既に実績があります。
例として、
  • Children’s Mercy Hospital of Kansas City;遺伝病を抱えて生まれてきた赤ちゃんのゲノム診断には、スピードと精度が必要。DRAGENサーバにより、これまでの解析パイプラインと比べて飛躍的に速く、そして正確にタイピングすることができるようになった。 このお話は、来月のアメリカ人類遺伝学会の、Edico Genome社のセミナーにて聞けますよ。 もちろん私も聞いてきます!
  • CDC(Centers for Disease Control and Prevention)では、Edico Genome社との共同研究を通じて、微生物ゲノムの研究に使用されているそうです。また、
  • PerkinElmer社のNGS解析パイプラインに採用されたり(この記事参照)、
  • Harvard大学やStanford大学では、300カバレッジのヒトリシークエンス解析を10分の1の時間(60時間→6時間)で完了したり(このニュース参照)、
と、まだこれからですが、ゲノムシークエンスの解析の分野で、久々にすごい技術革新が登場したという印象があります。

興味ありませんか?


解析サーバは前回のブログ記事のスペックです。
このサーバでMiSeqからHiSeqXまで対応できるとのこと。こちらのサーバは買取り。
これにボードが付いてきて、ボードは年間レンタル。
解析するデータ量に従って課金されるランクが変わるシステムです。
携帯電話みたいな感じですね。 一応、「パケ放題」も対応してますがX10システムでもない限り必要ないでしょう。

興味ありませんか?

無料トライアルもできます。
データを送って、解析結果を返却、のような流れです。
これでは速さが実感できませんが、タイムスタンプを信じて下さいね。

もう一度、

興味ありませんか?(しつこい)

価格とかトライアルとかについて知りたい! という方は是非、ご連絡下さい。
まだ弊社のホームページは準備されていないので、私宛のメール宛てにお願いします。

ken_osakiあdigital-biology.co.jp 「あ」を@に変えて下さい

gmail, hotmail 以外のメーラーで送って下さいね。
ホームページ準備されたらそのリンクに書き換えます。

もちろんこのブログにコメントでもOKです。

アメリカ人類遺伝学会の後に、もっと情報アップデートできると思います。
楽しみにしていてください!

2015年9月7日月曜日

超高速でNGS解析 DRAGEN(1)

NGS解析で一番困っていることは何ですか?
データの量が多すぎ? 解析サーバが非力? ゆえに結果が出るまでのスピードが遅い?
良く引き合いに出される、「ムーアの法則以上に、NGSのスループット革新は速い」というのは、解析するほうにとっては頭の痛い問題。

じゃあどうするか?
仕方が無いので解析サーバを増強したり、スパコン借りたり(操作できるひとは限られるでしょうが)、外注に出したり。
でもやっぱり行き着くところは、大量のデータ解析をするには、それなりの計算サーバが必要だということ。
日本にも、ライフサイエンス関連でいうと、何社かありますよね、NGS解析環境を作ってくれるサーバ屋さん。学会展示会場で良く見かけます。
彼らに共通するのは、汎用サーバを、NGS解析用に適した環境にカスタマイズしてくれるということ。
汎用サーバの中にNGS解析ソフトウェアをインストールして、メモリをうんと積んだり、ディスクをいいもの使ったり、I/Oを速くしたりしていると思います。
なので、同じソフトウェアを使っている限り、劇的にスピードがアップするということは無い。

でも、もし、ハードウェアからNGS解析用にチューニング・設計して、それに合ったソフトウェアを乗っけたNGS専用サーバがあったらどうでしょう?

あるんです!


今年(2015年)の「NGS現場の会・つくば大会」で、私の発表を聞いた方はご存知かもしれませんが、すごいNGS解析サーバが日本にやってきました。

その名も DRAGEN: Dynamic Read Analysis for GENomics

これが超速解析サーバなんです。
例えばショートリードでヒト全ゲノムをリシークエンスして変異解析をするとき、基本的に以下の順序で行います。
  1. BCL→FASTQ変換
  2. FASTQクオリティフィルタリング
  3. リファレンスマッピング(BWA)
  4. マッピングポジションをソーティング
  5. ダブっているマッピングを除去(リピート部分など)
  6. BAMファイル圧縮出力
  7. バリアント検出(GATK)
  8. VCFファイルの出力
このパイプラインを、ヒトゲノム30xのデータで行なった場合、皆さん、どれくらいの時間で終了していますか?

サンプルデータはSRA056922(NA12878の、全ゲノムリシークエンス)
101bpのペアエンドリード(平均距離410bp ± 14bp)が10億8000万本(ヒトゲノム30カバレッジ)
これを、
CPU: Intel Xeon E5-2697v2、2.7GHz、12コア
Memory: 128GB

Disk Controller: 6 GB/s; Support for JBOD (pass through); Support for TRIM commands
Stagind Disk: 8 x 400 GB RAID-0 SSD (High Endurance Intel SSDs)
OS Disk: 2 x 120GBSSD in HW RAID 1 configuration
のサーバ
ふつーのワークステーションサイズ
で、やったとします。
BWA-MEM 0.7.9a/GATK-HC 3.1.1でデフォルトで解析したとき、BCLからVCFまで、かかった時間は約9時間
同じ解析を、DRAGEN Genome Pipeline 1.3 でランすると、何と、20分弱で終了!

9時間が20分ですよ。すごいでしょ。
説明を追加

速く解析が終わるということは、精度を犠牲にしているのでは?

いえいえ、そんなことはありません。
以下のテーブルを見て下さい。

真陽性はBWAパイプラインとほとんど変わらず。
擬陽性はDRAGENの方が勝っています。
SNPのROCカーブも、BWA-GATK、DRAGEN共にほとんど変わりません。

DRAGENパイプラインは、マッパーやバリアントコーラーに、独自のものを使っています。
BWAと全く同じでは無いですが、原理は同じようなものだそうです。
バリアントコーラーも、HMMを用いた検出アルゴリズムを使っています。
まもなく論文にそのあたりが明らかになる予定です。

でも、なんでそんなに速いのでしょう?
その秘密は次回のお楽しみ