Tech & Science 2020.02.10 09:06 Cloud Composer と GKE を活用して機械学習のワークフローを構築する GKE を効率的に使うために 弊社の機械学習基盤では、ワークフロー管理ツールとして Cloud Composer (Airflow) を利用しており、機械学習タスクは別の Google Kubernetes Engine (以下、 ...
Tech & Science 2020.04.13 08:07 機械学習基盤における Cloud Dataflow の活用 Cloud Dataflow の使い所 Cloud Dataflow は GCP で提供されているサービスの一つで、フルマネージドな環境で ETL 処理を実行することができます。バッチ処理とストリーミング処理を統一的に扱うことのでき...
Tech & Science 2020.12.22 08:35 少人数の開発で Kubernetes を活用するための設計戦略 この記事は GiXo アドベントカレンダー の 22 日目の記事です。昨日は、 ギックスの考えるデータサイエンスとは でした。 MLOps Div. の廣津です。最初に断っておきますが、タイトルは半分釣りのポエム記事です。 本...
Tech & Science 2014.03.09 10:56 「確率がとても低い事象の分析」に全量データ分析は威力を発揮|ビッグデータ分析の留意点② 「ロングテール」に代表される確率が低い事象には全量データ分析 本日は、全量データ分析の優位性①にあたる、以下のポイントについて説明します。 優位性①:確率が低い事象を扱う場合に、サンプルデータでは得られない知見が得られるという点で、...
Tech & Science 2014.07.29 09:02 「Tableau(タブロー)」を使ってみた|利用頻度の高いグラフ作成① ~月次数値の対前年比較 利用頻度の高いグラフを作成し、Tableauの操作チップスを紹介する 前回の記事でご紹介したとおり、Tableauは感覚的に操作でき試行錯誤しながらグラフを作れる、自由度の高いソフトです。ただ「試行錯誤でき自由度が高い」という優位性のトレ...
Tech & Science 2014.09.09 09:06 Geek at GiXoの分析ツール使いこなし術|TableauとRの連携 第2回 TableauとRを連携させる 前回は、TableauとR連携の準備を進めてきました。意外と簡単に設定が出来たかと思います。今回は、実際にTableau-R連携環境で何ができ、どのような仕組でTableauとRが連携されているのかを確認し...
Tech & Science 2014.12.23 09:04 Python+Anaconda+Eclipseのインストール手順/PythonとRのビッグデータ統計分析の比較 第2回 AnacondaとEclipseの導入・連携の手順 前回の記事では、統計モデルを構築する上でRの他にPythonを利用する方法があることや、その環境を構築する上で必要となるモジュール群の概要を説明しました。今回は、AnacondaとEcl...
Tech & Science 2015.02.18 09:10 火事場泥棒・焼け石に水な打者(パ・リーグ)|プロ野球データでクロス集計 with Tableau 第7回 2014年のプロ野球全打席データをクロス集計していきます 2014年のプロ野球の打席データを全量(約6.6万件)手元に置き、さまざまな切り口でクロス集計して、プロ野球全体の打席の傾向を見ていく「プロ野球データでクロス集計 with Tab...
Tech & Science 2015.10.01 08:50 Talendの無償版(TOS)と有償版(Enterprise)の違い|Talend Open Studio によるビッグデータ分析(第9回) 基本的なバッチ処理の開発なら無償版で十分。チーム開発や処理速度を求めるなら有償版が必要 今回まで様々なTalendの機能について、ご紹介してきました。これらの機能は、全て無償のTalend Open Studio(略称:TOS)のBig ...
Tech & Science 2017.06.12 08:35 データレイクとクラウドサービス ~②クラウドサービスが支えるこれからのデータレイク~ クラウドサービス進化によってデータレイクの運命が決まる 前回、データレイクとはどういうものか、データベースと何が違うかについて触れました。今回はクラウドサービスがデータレイクにどの様に影響しているか、そして、今後、データレイクはどの様に変...