AIデータ、欲しいデータを、
言葉で伝える。

AIがデータの取得方法を考え、Rスクリプトを生成・実行・検証。ファイル、データベース、クラウドサービス、Web、オープンデータなど、さまざまな場所からデータを取得し、すぐに分析できる形でExploratoryにインポートします。

データを取得するだけでなく、繰り返し使えるデータ取得の仕組みまで作ります。

AIデータで、2つのCSVファイルの取り込み方法をAIに相談し、生成されたRスクリプトと取り込んだデータのプレビューを表示する画面

データ取得で、こんなことに困っていませんか?

欲しいデータは分かっているが、SQLを書けない
公開されているデータを、どこから取得すればよいか分からない
APIのドキュメントを読んでスクリプトを書くのが難しい
複数のExcelファイルを毎回手作業で結合している
PDFやXMLなど、扱いにくいファイルからデータを取り出したい
データを取得しても、列名やデータ型を整えるのに時間がかかる
AIにコードを書かせても、正しく動くか自分で確認できない
一度取得できても、翌月また同じ作業を繰り返している

AIデータは、データ取得に必要な調査、コード作成、実行、検証、整形までを一つの流れとして支援します。

AIデータとは

欲しいデータを自然言語で指示するだけで、AIが取得方法を検討し、生成・実行・検証までを進めます。

1
欲しいデータを自然言語で指示

取得元や具体的な方法が分からなくても、最終的に欲しいデータを説明します。

例:添付した2つのファイルの中身を確認して、どのように取り込めばよいか提案して
2
AIが取得方法を考え、Rスクリプトを生成・実行

AIがファイル構成、データベースのスキーマ、APIドキュメント、Webサイトなどを確認し、目的に適したデータ取得方法を検討します。その結果をもとにRスクリプトを生成し、Exploratory上で実際に実行します。

3
結果を検証し、分析に使える形でインポート

AIはスクリプトを生成して終わるのではなく、取得結果がユーザーの依頼に合っているかを確認します。期待した結果でない場合は、取得方法を見直し、スクリプトを更新して再実行します。

あらゆるデータ取得方法を、自然言語から

Rで取得できるデータなら、AIデータの対象になります。

ファイル

  • Excel
  • CSV
  • JSON
  • XML
  • PDF
  • Word
  • 複数ファイル・複数シート

データベース

  • SQLデータベース
  • MongoDBなどの非SQLデータベース
  • 複数テーブルの結合
  • 集計・ランキング・累積値・移動平均などの複雑なクエリ

クラウドサービス

  • Google アナリティクス
  • Googleスプレッドシート
  • Stripe
  • セールスフォース
  • Amazon S3
  • 各種SaaS・Webサービス
  • 公開APIを持つサービス

Web・オープンデータ

  • Webサイト上のファイル
  • Webスクレイピング
  • 政府・自治体のオープンデータ
  • e-Stat(政府統計データ)
  • FRED(アメリカ経済指標)
  • APIやHTTPでアクセスできる公開データ

Exploratoryで直接サポートされていないサービスでも、公開されているAPIドキュメントをもとに、AIがデータ取得用のRスクリプトを生成します。

期待したデータになるまで、AIと対話

プレビューされた結果が期待と異なる場合は、追加の指示を入力できます。AIは追加指示を反映し、Rスクリプトを更新して再実行します。

会話
年度別のExcelファイルをすべてまとめてください。
列名にいくつか違いがあります。内容が同じと思われる列を統一して結合しました。
「満足度」と「総合満足度」は同じ列として扱ってください。回答者IDは文字列型にしてください。
指示を反映してスクリプトを更新しました。
データのプレビュー
respondent_idyearsatisfaction
00012320244
00012420245
00012520253
00012620254
✓ 「満足度」列に統一・回答者IDを文字列型に変換しました。
追加で指示できること
01取得条件を変更する
02使用する表やシートを指定する
03列名を変更する
04データ型を指定する
05複数のデータを結合する
06不要な行や列を取り除く
07データの形式をロング型、ワイド型に変換する

取得したデータを、すぐに分析できる形へ

自動で行われる処理の例
複数ファイルの結合
複数テーブルのマージ
列名の統一
コードからラベルへの変換
データ型の調整
日付形式の統一
不要なヘッダーや注釈行の除去
分析しやすい表形式への変換

取得した直後から、チャート、集計、統計分析、レポート作成へ進めます。

AIデータ→データの加工→可視化・集計→分析→ダッシュボード・レポート

データではなく、再現可能な仕組みが残る

一度取得できれば、次回からは「再インポート」するだけ。

AIデータでは、取得されたデータだけでなく、そのデータを取得するためのRスクリプトが保存されます。最新データを取得するときは、再度AIに依頼する必要はありません。ユーザーが「再インポート」を実行すると、保存されたRスクリプトが再実行され、最新のデータが取得されます。

メリット
同じ手順で最新データを取得できる
手作業による取得方法の違いを防げる
毎回AIを実行する必要がない
不要なAIトークンを消費しない
定期的なレポート更新に利用できる
データ取得の手順を確認できる

一度きりのデータ取得を、繰り返し使えるデータパイプラインに。

すべての試行錯誤をバージョンとして保存

AIへの指示によってRスクリプトが更新されるたびに、それぞれのスクリプトがバージョンとして保存されます。新しい指示によって結果が期待と異なった場合でも、過去のバージョンへ戻すことができます。

AIデータのRスクリプト欄で、属性列名を変更したv2と、変更前のv1のバージョンを切り替える画面
メリット
変更前の取得方法を失わない
複数の方法を試しながら改善できる
いつ、どのような変更を行ったか確認できる
安心してAIとの試行錯誤を進められる

一度見つけた取得方法を「スキル」として再利用

一度AIが最適なデータ取得方法を見つけると、その情報はスキルとして保存されます。次に同じようなデータを取得するときは、最初から同じ調査や試行錯誤を繰り返す必要がありません。さらに、スキルを共有することで、別のユーザーも最初から実績のある取得方法を利用できます。

スキルの例
01社内データベースからの標準的なデータ取得方法
02定期レポート用のGoogle Analyticsデータ
03e-Statから地域データを取得する方法
04自社独自フォーマットのアンケートデータ処理
05特定ベンダーのPDF帳票から表を抽出する方法

個人の試行錯誤を、チーム全体のベストプラクティスへ。

データベースの構造を理解して、最適なSQLを生成

テーブル名を知らなくても、欲しいデータからSQLを生成。

データベースへのコネクション設定時に、AIが参照できるスキーマ情報を登録できます。AIはその情報をもとに、ユーザーの依頼に必要なテーブル、列、結合方法を判断し、SQLを生成します。

メリット
SQL生成までの時間を短縮できる
使用するテーブルの判断精度が向上する
不要なスキーマ情報をAIに渡さずに済む
組織のデータ構造を反映したSQLを生成できる

例えば、こんな依頼からSQLを生成

製品ラインごと・四半期ごとに、売上、四半期内ランキング、累積売上、前四半期比、全社売上に占める構成比、4四半期移動平均を一つの表にまとめて。
AIが生成するSQLに含まれる処理の例
01テーブル結合
02ランキング関数
03累積値・移動平均
04四半期比較

AIは、データベースの種類やバージョンも考慮し、利用可能なSQL関数を使ってクエリを生成します。

データ接続の面倒な設定は、AIデータに任せる

データベースに接続するには、ドライバーのインストールや接続情報の設定を事前に済ませておく必要があります。APIからデータを取得する場合も、APIキーやクライアントIDなどの登録が必要です。

AIデータを使えば、こうした接続のための設定もAIに任せて、簡単に済ませることができます。

AIデータの代表的な活用例

活用例1:アンケートのレイアウト表と回答データを統合

課題:回答データでは、質問や回答がコードで保存されているため、そのままでは内容が分かりにくい。

指示例:レイアウトデータと回答データを使ってデータを整えてください。設問コードと回答コードはラベルに置き換えてください。
AIデータが行うこと
01レイアウト表と回答データの構造を確認
02設問コードと質問ラベルを対応づける
03回答コードを回答ラベルに変換
04分析可能なデータとしてインポート

活用例2:年度別のExcelファイルを統合

課題:年度ごとにファイルや列名が異なるため、単純に行を追加できない。

指示例:フォルダにあるすべての年度のデータを、一つのデータフレームにまとめてください。
AIデータが行うこと
01対象となるExcelファイルを確認
02各年度の列構成を比較
03表記が異なる列名を統一
04欠けている列や追加された列を処理
05年度を識別する列を追加して結合

活用例3:PDFから必要な表を取得

課題:PDFに複数の表やページがあり、どの表を読み込めばよいか分からない。

指示例:このPDFファイルからデータを取得して。
AIデータが行うこと
01PDF内のページと表を診断
02取得可能な表の一覧を提示
03ユーザーが選択した表を抽出
04ヘッダーや注釈を整理
05表形式のデータとしてインポート

活用例4:e-Statから地域人口データを取得

課題:欲しい地域単位のデータが直接公開されておらず、e-Statのデータ形式も分析しにくい。

指示例:自由が丘の人口データを男女別に取得して。
AIデータが行うこと
01対象データをe-Statから検索
02「自由が丘」に該当する地域区分を調査
03必要な丁目単位のデータを取得
04複数地域のデータを結合
05男女別人口として集計
06可視化しやすい形式に整形

活用例5:Google Analyticsデータを取得

課題:GAの管理画面やAPIドキュメントを見ながら、必要なディメンションと指標を自分で組み立てるのは手間がかかる。

指示例:GAの指定したプロパティから過去30日分を取得してください。日付、デバイス、チャネル、国の組み合わせ別に、セッション数、アクティブユーザー数、新規ユーザー数、ページビュー、エンゲージメント率、平均エンゲージメント時間、イベント数、直帰率をまとめてください。
AIデータが行うこと
01指定プロパティへ接続
02必要なディメンションと指標を設定
03GA APIの制約を考慮してデータを取得
04複数の結果が必要な場合は結合
05分析用の表に整える

こんな方におすすめです

SQLやプログラミングに詳しくない方

欲しいデータを自然言語で説明することで、SQLやRを自分で書かずにデータを取得できます。

ファイルの整理に時間を使っている方

複数のExcelファイルや、レイアウトの異なるデータを結合・整形できます。

オープンデータを活用したい方

公開場所やAPIの使い方が分からなくても、AIが取得方法を調査します。

APIやWebサービスからデータを取得したい方

Exploratoryが直接サポートしていないサービスでも、公開APIを使った取得方法を検討できます。

毎月同じデータ取得作業をしている方

保存されたRスクリプトを再実行することで、最新データを繰り返し取得できます。

チーム内でデータ取得方法を標準化したい方

作成したスキルを共有し、同じ方法をチーム全体で利用できます。

よくある質問

どのようなデータに対応していますか

Exploratory で現在お使いいただけるデータソースは、そのまま AI データでもご利用いただけます。すでに作成済みの接続情報は AI データの画面に一覧として表示されますので、あらためて接続を設定していただく必要はありません。

対応しているデータソースの主なものは次のとおりです。

  • ファイル:Excel、CSV、PDF、Word、JSON、XML、Parquet、および SPSS や Stata などの統計ソフトの形式に対応しています。
  • データベース:PostgreSQL、MySQL、SQL Server、Oracle、BigQuery、Snowflake、Redshift、MongoDB などをご利用いただけます。
  • クラウドストレージ:Google ドライブ、Google スプレッドシート、Amazon S3、SharePoint、Dropbox、Box に保存されたファイルを、直接お取り込みいただけます。

これらに加えて、e-Stat(政府統計の総合窓口)をはじめとする公的統計や、各種の公開API、Web 上に公開されている資料からもデータを取得できます。あらかじめ専用の手順を用意していないデータソースについても、仕様を調べたうえで取得を試みますので、まずはご要望をそのままお伝えください。

AI が勝手に集計や計算をしてしまうことはありませんか

ご懸念のような動作は行いません。AI データが担当するのは、指示されたデータの取得と、分析に使える形への整形までです。指示していない指標を独自に作り出すことはありません。

インポート時に行うデータの加工については、「整然データの形への変換」と「データタイプの変換」に限定しています。合計や比率といった新しい列を、AI データの判断で追加することはありません。

取得された数値が元のデータのどの値に由来するかは、生成された R スクリプトからたどっていただけます。

もしインポート時点で追加で加工したい要件があれば、AI データのチャットで追加で指示していただくことで加工することは可能です。

取得したデータは、そのまま分析に使えますか

そのままお使いいただけます。取り込みの前に、次の形に整えます。

  • 1行が1つの観測を表す形にします
  • 1つの列が1つの変数を表す形にします。同じ指標が複数の列に分かれている場合は、1つの列にまとめます
  • 1つのセルには1つの値だけが入る形にします

あわせて、空の行や、脚注や出典などデータではない行を取り除きます。取り込みが完了した時点で、そのままチャートの作成にお進みいただけます。

API キーやデータベースの接続情報は、AI に渡りますか

渡ることはございません。認証情報の取り扱いについては、次のとおり設計しています。

  • API キーやパスワードなどの認証情報を、チャットでお伺いすることはありません
  • 認証情報を R スクリプトに直接書き込むことはありません
  • データベースに接続する場合、R スクリプトの先頭では、Exploratory 側が保持している接続情報を変数として差し込む形になります。ホスト名やポート番号が AI に渡ることはありません

API キーの入力が必要なデータソースをお使いの場合は、専用のダイアログを表示してご入力いただく形になります。ご入力いただいた値は Exploratory の内部で保持され、AI に対してそのまま渡されることはありません。

データのどこまでが AI に送られますか

データの取得方法を組み立てるために必要な範囲の情報が送られます。具体的には、ファイルの列名と先頭の数行、およびデータベースのスキーマ情報です。ファイルの構造が複雑で、先頭の数行だけでは見出しとデータの境目を判断できない場合には、読み取る行数を増やすことがあります。

取得したデータそのものは、生成された R スクリプトをお使いの環境で実行することによって取り込まれます。

データが更新されるたびに、AI に指示し直す必要がありますか

その都度指示し直していただく必要はありません。

一度取り込みが完了すると、生成された R スクリプトがデータソースとして保存されます。元のファイルやデータベースの内容が更新された後は、再インポートボタンを押していただくだけで、保存されたスクリプトのみが実行されます。

AI をあらためて動かすことはありませんので、毎回同じ手順で最新のデータをお取り込みいただけます。

同じ処理を繰り返し実行しても結果が変わらないため、定期的に更新されるデータの取り込みにも安心してお使いいただけます。

データのインポート後に、追加の指示を出すことはできますか

インポート後のデータは、Exploratory の通常のデータフレームと同じように扱われます。そのため、一度取り込んだ後であっても、条件を変更したり不要な行を除いたりといった調整を、続けて行っていただけます。

操作としては、ソースステップ(1番目のステップ)のトークン(グレーのボックス)から AI データを再度開いてください。

取り込みのときのやり取りがそのまま残った状態で開きますので、そこに追加の指示を入力して送信いただければ、これまでの内容を踏まえたうえで、今回の変更点だけが反映されます。最初から指示をやり直していただく必要はありません。

同じような処理を、毎回指示し直す必要がありますか

その必要はありません。

データフレームを作成または更新されたタイミングで、そのとき使われた手順が自動的にスキルとして保存されます。次に似たような構造のデータをご指定いただいた際には、保存された手順をもとに、列名などの違いを調整しながら同じ処理を適用します。

スキルの中身は、どのようなご依頼のときにどのような R スクリプトを書くかをまとめた、マークダウン形式のファイルです。.exploratoryのレポジトリにある「ai_skills」のフォルダの「datasource」のパスに保存されていますので、内容を確認して意図しない処理が保存されていないかを後から確かめていただくこともできます。

そのデータ、AIに取りに行かせてみませんか。

取得したいデータを、普段使っている言葉で説明してください。AIデータが取得方法を考え、実行し、検証し、分析に使えるデータとしてExploratoryにインポートします。

ノート名を入力
ノート・エディターを起動中...