データ分析・統計

データを集計し、図とレポートで結果を示します。

CSVやExcelをお預かりし、差・傾向・関係を確かめます。何が言えて、どこからは言えないかを分け、図と文章でお返しします。自由記述や問い合わせ文など、日本語の文章データにも対応します。

公開データを再集計し、結果と限界を示します。

元データ、分母、計算方法、限界に加え、企業が決める項目も一つのページに記載しています。

公開分析

小中高の在学者、学校、本務教員の2024年から2025年の増減率を並べた棒グラフ

教育・学校基本統計

小学生12.9万人減、学校215校減。学校数は同じ速さで減っているか?

小学校の在学者は2.18%減り、学校数は1.14%減、本務教員は0.07%減でした。1校当たり在学者数は315.7人から312.4人へ低下しました。施設と人員の調整は在学者減より緩やかですが、全国集計だけで統廃合の良否や学級規模は判断できません。

要点・図表・詳しい考察を確認する
高等教育8区分の女性比率を24.0%から84.4%まで示す横棒グラフ

教育・高等教育

大学学部46.1%、大学院33.2%、高専24.0%。同じ高等教育で括れるか?

女性比率は大学学部46.1%、大学院33.2%、高等専門学校24.0%でした。短期大学84.4%、専門学校57.4%まで含めると、制度区分の幅は60.4ポイントです。『高等教育全体』の平均では、どこに代表性の段差があるかを隠します。

要点・図表・詳しい考察を確認する
総数、持家、貸家、分譲住宅の2011年から2025年の推移線

不動産・建築着工統計

新設住宅は74.1万戸、3年連続減。貸家43.9%の市場で何が縮んだ?

2025年の新設住宅は740,667戸、前年比6.5%減でした。51,528戸の減少は、持家16,890戸、貸家17,101戸、分譲17,146戸とほぼ3分されます。開始年を変えた10本の傾向線はすべて負でしたが、年当たり減少幅は0.9万〜2.4万戸に動き、速度は期間依存です。

要点・図表・詳しい考察を確認する
2015年53.3万戸、2025年158.8万戸、2035年313.1万戸、2045年503.6万戸を示す棒グラフ

不動産・マンション高経年化

築40年超は158.8万戸、20年後503.6万戸。建替え323件で追いつくのか?

築40年以上は2025年末158.8万戸、現ストック723.6万戸の約21.95%です。2045年には503.6万戸の見込みです。建替えの累計は323件・約2.6万戸です。定義と期間が違うため『1.6%しか進んでいない』とは計算せず、規模差が示す管理・修繕・再生の選択肢の広さを考えます。

要点・図表・詳しい考察を確認する
小6と中3の国語・算数数学について、学習時間の回答群別平均正答率を示す四つの折れ線グラフ

教育・学習行動の公開データ分析

休日の小6算数で29.6ポイント差。それでも長時間が原因とは言えない。

小学校6年生と中学校3年生の質問紙回答別に、国語・算数/数学の平均正答率を比較しました。最上位回答群と最下位回答群の単純差は14.0〜29.6ポイントでしたが、平日3時間以上が常に最高ではありません。学習時間、学習計画、振り返りを分け、関連と因果の境界を示します。

要点・図表・詳しい考察を確認する
公立小中高校の学年別学習費を学校教育費、給食費、学校外活動費で積み上げた棒グラフ

教育・家計の公開データ分析

中3の学校外活動費44万6,096円。総額だけでは何を見落とす?

年間の学習費総額だけを見ると、入学時の学校教育費と、後半学年に増える学校外活動費が相殺されます。公立小・中・高の学年別平均を費目別に分け、家計負担が大きい時期の変化を整理しました。

要点・図表・詳しい考察を確認する
47都道府県の賃貸用構成比とその他空き家構成比を、二次的住宅と地価変動率も含めて示した散布図

不動産・地域の公開データ分析

空き家の構成差96.32%を二軸へ。空き家率一本で地域を比べられるか?

47都道府県の空き家を、賃貸用・売却用・二次的住宅・その他の四つへ分け、構成比として主成分分析しました。最初の二つの連続軸で構成比変動の96.32%を要約できましたが、その軸は固定的な地域分類でも政策の優先順位でもありません。

要点・図表・詳しい考察を確認する
学習塾費、体験活動・地域活動、芸術文化活動、スポーツ・レクリエーション活動の4費目について、支出ゼロを含む全体平均を公立小学校・公立中学校で比較する図。

教育・学校外活動の公開データ分析

塾代7万5,194円、支出率39.0%。平均だけで需要を判断できるか?

公立小学校・公立中学校の学校外活動費を、支出ゼロを含む全体平均、支出率、支出者平均に分けて検証しました。同じ平均額でも支出の広がりと支出者の金額は異なります。需要や価格を判断する前に必要な追加調査まで並べます。

要点・図表・詳しい考察を確認する
2015–2020年の人口と総世帯増減率の比較。人口減少と総世帯増加が14市で重なる。

不動産・長野県19市の公開データ分析

長野19市中14市で、人口が減っても世帯は増えた。

長野県の全19市では、人口が減っても総世帯数が増えた市が14あります。2015–2020年の国勢調査と2023年の住宅・土地統計調査を地域コードでつなぎ、人口・世帯・空き家の種類を分けて比較しました。県内58町村を対象外とする地域ケース分析で、長野県全体や全国の推計ではありません。

要点・図表・詳しい考察を確認する
8区分の年間平均を同じ金額軸で比較。私立小学校174.2万円、公立小学校36.7万円。

教育・家計の公開データ分析

私立小学校174万円、公立小学校37万円。差はどこで生まれる?

公立・私立の差を、費目・学年・学校所在地の人口規模に分けて検証。全国平均だけでは分からない支出の違いを確認し、教育サービスの企画で追加確認が必要な条件まで整理しました。

要点・図表・詳しい考察を確認する
賃貸・売却用及び二次的住宅を除く空き家率が高い10県について、空き家全体の率と比較。

不動産・地域の公開データ分析

空き家900万戸は、全部同じ「空き家」なのか?

空き家の戸数、総住宅に対する率、空き家の中の構成比を分ける。全国・47都道府県の比較に、似た空き家率でも内訳が異なる地域の対照と、住宅地価との探索的な照合を加えました。

要点・図表・詳しい考察を確認する
青と緑のガラスノードから三つの異なる発信先へ経路が分かれるネットワーク模型

SNS公開データ分析

企業向け発信は、Xで見つけてもらい、サイトで判断してもらう。

月間利用者数、広告到達人数、登録会員数を混ぜず、比較できる数字だけを順位化。X、LinkedIn、企業サイトの役割と4週間の営業実験を示しています。

分析と営業実験を見る
研修バインダー、時計、担当者トークン、確認カードを並べた紙模型

職場研修の公式調査

人材育成に問題がある事業所は79.9%。教材を増やせば解決するのか?

人材育成に問題がある事業所は79.9%。指導者不足、育成後の離職、時間不足を回答対象ごとに集計し、研修資料で減らせる説明負担と、資料だけでは解決しない問題を分けました。

職場研修の分析を見る
住宅地、商業地、工業地を異なる高さの地形として表した都市模型

国交省の不動産分析

地価は上がった。それでも地方四市は、住宅・商業・工業すべてで減速した。

住宅・商業・工業、三大都市圏・地方圏、前年からの加速・減速を分けました。変動率に加えて、47都道府県への広がりと標準地点数も併記しています。

地価公示分析を見る
中古マンションの売出価格三千万円を見て考える成人女性の漫画ページ

国交省データの不動産分析

売出価格は、そのまま「相場」と呼べるのか?

売出価格、取引価格情報、地価公示の役割を分け、物件種別・地域・時期・面積・築年・駅距離をそろえる比較手順と、現地・管理資料で確認する限界をまとめました。

調査結果と漫画を見る

103機能の組み合わせ方

実行確認済みの103機能から、データに合う方法を選びます。

公開データごとに分母、単位、期間、欠損を点検。条件を変えた再計算で結果が同じかを確かめ、採用しなかった方法と不足していたデータも記録します。

実行確認済み
103
  1. 01

    取得

    openpyxl・duckdb・polars

    公式ExcelやCSVを読み、原本URLと取得日を固定する

  2. 02

    監査

    pandas・numpy・missingno

    列、単位、欠損、重複、分母を検査する

  3. 03

    比較

    scipy・statsmodels・researchpy

    割合、差、相関を問いに合う方法で測る

  4. 04

    構造

    linearmodels・scikit-learn

    地域差や複数軸を必要な場合だけ分ける

  5. 05

    感度

    ruptures・SALib

    期間や除外条件を変えて結果が同じか確かめる

  6. 06

    公開

    matplotlib・seaborn・plotly

    本文、表、図の数値を一致させて公開する

実行確認済み

データ分析ソフト103機能の実行検証

103機能

検証済みの103機能を詳しく見る

解析はPythonで行います。この一覧は、各機能で小さな分析を実行し、結果が返ることを確認した103件です。読み込みだけ成功したもの、実行結果を確認できなかったもの、検査に失敗したものは含めていません。依頼では目的とデータに合う方法だけを選び、使った手順と検定をレポートに記録します。

基礎

数値計算と表データの集計

  • numpy
  • pandas

検定

カイ二乗、t検定、順位検定

  • scipy
  • dcor
  • hyppo

回帰

重回帰とロジスティック回帰

  • statsmodels
  • formulaic
  • patsy

機械学習

クラスタリング、主成分、予測

  • scikit-learn
  • prince
  • kmodes
  • kneed
  • minisom

心理統計

尺度、反復測定、因子・構造分析

  • pingouin
  • factor_analyzer
  • semopy
  • scikit-posthocs
  • researchpy
  • pyreadstat
  • statsmodels(MixedLM)

予測

勾配ブースティング、説明、調整、欠損補完

  • scikit-learn(IterativeImputer)
  • xgboost
  • lightgbm
  • shap
  • optuna
  • imbalanced-learn
  • category_encoders
  • feature-engine
  • yellowbrick
  • catboost
  • river

ベイズ

MCMC、収束診断、ベイズ回帰

  • pymc
  • arviz
  • bambi

因果推論

因果グラフ、Double ML、固定効果・操作変数

  • dowhy
  • econml
  • linearmodels
  • causal-learn
  • pyhdfe

時系列

需要予測、ARIMA、変化点、GARCH、DTW

  • prophet
  • pmdarima
  • statsforecast
  • arch
  • ruptures
  • sktime
  • tslearn
  • holidays
  • utilsforecast
  • skforecast
  • tsfresh
  • pymannkendall
  • filterpy
  • pykalman

生存分析

Kaplan–Meier、Cox、機械学習型生存予測

  • lifelines
  • scikit-survival

マーケティング

併売分析、次元圧縮、密度クラスタ

  • mlxtend
  • umap-learn
  • hdbscan

テキスト

日本語形態素解析、トピック、読みやすさ

  • janome
  • fugashi
  • sudachipy
  • gensim
  • wordcloud
  • spacy
  • textstat
  • nltk

ネットワーク

共起、中心性、コミュニティ検出

  • networkx
  • python-louvain
  • igraph
  • pydot
  • pyvis

可視化

統計図、対話グラフ、欠損・画像特徴

  • matplotlib
  • seaborn
  • plotly
  • missingno
  • scikit-image
  • statannotations
  • bokeh
  • altair
  • plotnine
  • datashader
  • holoviews

データ処理

SQL、高速表処理、Parquet、Excel

  • duckdb
  • polars
  • pyarrow
  • openpyxl
  • sparse
  • xarray
  • dask
  • pyjanitor

感度分析

入力が結果へ与える影響と確率モデル

  • SALib
  • openturns

最適化

制約付き配分と線形・二次計画

  • cvxpy
  • highspy

数式

記号計算と厳密な恒等式の照合

  • sympy

数値計算

自動微分と数値微分

  • autograd
  • numdifftools

高速計算

大量再計算と配列式の高速実行

  • numba
  • numexpr

記述統計

多次元データの要約統計

  • xarray-einstats

データ品質

スキーマ、型、欠損、列定義の検証

  • pandera

異常検知

外れ候補と逐次変化の検出

  • pyod

確率モデル

依存構造と分布の診断

  • copulas

知りたいことから、分析方法を選びます

知りたいこと使う手法
AとB、どちらが良かったのか2群の比較(t検定/Mann-WhitneyのU検定)、比率のA/Bテスト、信頼区間と検出力、それに必要な標本数
3つ以上の店舗・教室・施策で差はあるか分散分析/Kruskal-Wallis検定と、その後の多重比較(Tukey HSD/Dunn+Holm補正)
結果を動かしているのは何か重回帰分析、ロジスティック回帰、多重共線性(VIF)と残差の診断
顧客・生徒・商品をどう分けるかクラスター分析(k-means)、主成分分析
自由記述・問い合わせ文に何が書かれているか日本語形態素解析、頻出語と特徴語(log-odds)、共起ネットワーク、トピック抽出
増えているのか、季節の波なのか時系列のトレンド検定(Mann-Kendall/Sen勾配)、季節分解

入力はCSV・TSV・JSON・Excelに対応します。文字コードは自動で判別します。

データの前提を確かめてから、分析方法を決めます

  1. 01受け取る
  2. 02確かめる
  3. 03選ぶ
  4. 04測る
  5. 05描く
  6. 06書く

問い、集め方、比較単位、欠測、標本設計を確かめ、主要な指標と方法を決めます。正規性検定の合否だけで機械的に検定を切り替えたり、有意になる方法を探したりはしません。公式集計では記述的な分解にとどめる場合もあります。効果量、仮定、感度、限界と、なぜその方法を選んだのかをレポートに残します。

分析例と、そこから分かったこと

実際の学習ゲームや動画から集計した例と、手法を説明するための架空データを分けて掲載しています。

01

自社の学習ゲームに、自分で気づけない配置の偏りがあった

クイズ150問の正解位置の分布。修正前は2番に65問、4番に9問と偏っていた。修正後は38・38・37・37に均等化した。

中学5教科150問のクイズです。正解が選択肢の何番目にあるかを数えたところ、2番が65問、4番が9問でした。カイ二乗適合度検定で χ² = 43.17、p < 0.000001。一様配置を仮定したモデルとは大きく異なる分布です。2番だけを選ぶと150問中65問に正解するため、知識とは別に選択位置が得点へ影響する設計でした。

直したのは並び順だけです。正解の文字列は1問も変えていません。修正後は 38・38・37・37 になり、χ² = 0.03、p = 0.9989。観測した正解位置の分布はほぼ均等になりました。

目で見て気づけるものではありませんでした。数えて、検定して、初めて見えた配置の偏りです。

02

同じ商品の中に、揃っていない部分が残っていた

教科別の問題文の文字数の箱ひげ図。英語だけ中央値67字で突出し、理科は21.5字。

同じクイズの中で、問題文の長さが教科ごとにどれだけ違うかを調べました。Kruskal-Wallis検定で H = 77.66、p < 0.000001、効果量 ε² = 0.508(大)。その後の多重比較(Dunn検定+Holm補正)で、英語は他の4教科すべてに有意に長いと出ました。

中央値は英語が67字、理科が21.5字で約3倍です。スマートフォンの縦画面とゲーム内の吹き出しでは、英語だけ読み切れません。

「なんとなく英語が長い気がする」で終わらせず、どの組み合わせが、どれだけ違うのかまで出すのが多重比較です。

03

「新案が勝った」で終わらせない

A/Bテストの成約率。現行案12.0%、新案15.0%。誤差棒は95%信頼区間。検出力50%、必要標本数は1群2,031。

※このセクションは手法を示すための架空データです。

各1,000件で、現行案12.0%・新案15.0%。差は+3.0ポイント、相対では+25%です。ここで「新案の勝ち」と報告することはできます。

ただし比率のz検定は p = 0.0496、Fisherの正確確率検定は p = 0.0576。判定が割れています。境目に乗っているということです。さらに、この標本数でこの差を検出できる確率(検出力)は約50%しかありません。検出力80%で判定するには1群あたり2,031件が要ります。

この結果だけで全面展開を決めず、実務上必要な差、費用、信頼区間を併記しています。1群2,031件は仮定した効果に対する事前設計の目安です。結果を見た後に約1,000件ずつ追加し、有意になるまで同じ検定を繰り返してよいという意味ではありません。次の試験では標本数と停止規則を先に決めます。

04

動画説明文の語を数え、教科ごとのまとまりを確認

動画87本の説明文から作った共起ネットワーク。教科ごとに語のかたまりが分かれている。

自社で公開している動画87本の説明文を形態素解析し、同じ文章の中に一緒に出てくる語を線でつなぎました。全体の6割以上に現れる定型文(署名や注意書き)は自動で除いています。除かないと、その定型文だけが上位を占めて何も見えません。

残った語は、教科ごとのかたまりに分かれました。書き手が意図して分類したわけではなく、分析結果で、教科ごとの語のまとまりを確認しました。

同じ処理は、アンケートの自由記述、問い合わせの本文、レビュー、日報にもそのまま使えます。群ごとの特徴語(log-odds)まで出すと、「どの層が何を言っているか」が語の単位で分かります。

05

効いている順に並べ替える

重回帰の標準化係数。プラン、訪問回数、メール開封数の順に効いている。年齢と検索経路は有意でない。

※このセクションは手法を示すための架空データです。

売上を目的変数に、訪問回数・メール開封数・年齢・流入経路・契約プランを説明変数として重回帰分析にかけました。n=300、自由度調整済み R² = 0.912、VIF最大値は2.16(問題となる多重共線性なし)。

単位がばらばらな変数を比べるため、標準化係数で並べています。最も大きいのは契約プランで、続いて訪問回数、メール開封数でした。年齢と検索経由の流入は、統計的に有意ではありませんでした。

統計的に有意でないことは、効果がゼロという証明ではありません。係数の不確かさと実務上意味のある大きさを確認し、追加調査が必要かを判断します。

なお、これは観察データの関連であって、介入すれば同じだけ動くという保証ではありません。因果を確かめたい場合は、先に実験の設計から相談してください。

分析結果を正しく扱うための前提

  1. 01

    因果は、観察データからは断定しません。効果を測りたい場合は、先に実験の設計(対象の割り付け・期間・測る指標)から相談してください。

  2. 02

    予測は確定値として扱いません。時系列や機械学習の予測には、誤差、検証期間、データの前提を併記します。

  3. 03

    集め方が偏ったデータは、どの検定を通しても偏ったままです。どう集めたかを最初に伺うのはそのためです。

  4. 04

    個人情報を含むデータは、そのままではお預かりしません。個人が特定される列を除いた状態、または統計処理済みの状態でお渡しください。

  5. 05

    検定の選択と結論の責任は人が持ちます。手順の一部は自動化していますが、前提の確認と最終的な解釈は自動化していません。

分析方法が決まっていなくても大丈夫です。データの列の意味と、集め方を教えてください。

分析を相談する