こんにちは、小澤です。
前回は、スクレイピングを定期実行して自動化する方法について紹介しました。cronやWindowsタスクスケジューラを使えば、毎日・毎時といった決まったタイミングでスクリプトを実行できます。また、ログを残すこと、エラー時の内容を確認できるようにすること、アクセス間隔や利用規約に配慮することも重要だということを説明しました。
ここまで説明してきた処理では、HTMLを取得し、BeautifulSoupで解析し、複数ページを巡回し、CSVやExcelに保存し、定期実行するところまで見てきました。かなり実務に近い流れになってきましたが、実際のWebサイトを扱っていると、もうひとつ大きな壁に出会うことがあります。それが、JavaScriptで動的に生成されるページです。
今回は、requestsとBeautifulSoupだけでは取得しにくいページがなぜ存在するのかを整理し、ブラウザを自動操作するSeleniumの基本的な考え方を紹介します。
この続きは以下をご覧ください
(リンク »)
お問い合わせにつきましては発表元企業までお願いいたします。

