“1億文書の全文検索システム”と聞けば、ほとんどの人が「そんなもの、うちには必要ない」と思われるだろう。しかし、何事も極端なチャレンジをしてみなければ、見えてこないこともある──。
そこで、実際にオープンソースの検索エンジンApache Solrで構築し、ファイルサーバ検索として本当に使えるのかどうか、様々な確度から検証した結果を紹介しているのが本資料である。
一口に“一億文書”と言っても、そう簡単に用意できるわけがない。そこで今回は日本語Wikipediaの全件データを100倍に増幅するという荒業を用いた。実証環境は、数年経過した普通の1Uサーバだ。Apache Solrは、鉄飛テクノロジーのファイルサーバ検索システム「Fileblog」にも組み込まれており、その活用領域の幅広さは今さら語るまでもないだろう。
1億文書のインデックス構築、全文検索は成功するのか?そして見えてきた、いくつかの運用課題や、改善ポイントとは?詳細は、ぜひ本資料から確認していただきたい。
ホワイトペーパー