【要約】The story of how I scraped 134 items from Brain's "Business" category [Zenn_Python] | Summary by TechDistill
> Source: Zenn_Python
Execute Primary Source
// Problem
筆者がBrainでの商品販売を検討する際、市場の需要や競合状況を正確に把握する必要があった。しかし、収集したデータには解析を阻害する複数のノイズが含まれていた。具体的には以下の課題に直面した。
- ・プラットフォームの構造的制約:検索結果が134件と少なく、市場規模の判断が困難であった。
- ・価格データの非定型性:価格に「¥」や「,」が含まれ、そのままでは数値計算ができなかった。
- ・販売数フォーマットの不一致:販売数が「(2 items)」のような文字列形式で記録されていた。
- ・データの欠損:評価(星)データが一部のアイテムにしか存在せず、統計に偏りが生じた。
// Approach
筆者はWebスクレイピング拡張機能を用いてデータを抽出し、PythonとPandasを用いてデータクリーニングと分析を行った。収集した生データを、統計解析が可能な形式へ変換するプロセスを以下の手順で実施した。
- ・データ収集:拡張機能を用い、タイトル、価格、販売数、出品者名等をCSV形式で出力した。
- ・正規表現による前処理:
re.sub等を活用し、価格や販売数から数値のみを抽出した。 - ・価格の数値化:
df['price'].apply(...)を用い、通貨記号や空文字を適切に処理した。 - ・統計的分析:価格帯別の集計や、推定売上(単価×販売数)によるランキング作成を行った。
// Result
分析の結果、プラットフォームの構造と高収益なニッチ領域が定量的に判明した。これにより、筆者は自身の参入戦略を策定するための具体的な根拠を得た。
- ・価格構造の解明:5,000円以上の高額商品が全体の3分の1以上を占める実態を特定した。
- ・成功パターンの抽出:実績に基づいた「講座型商品」が売上の上位を占めることを確認した。
- ・トレンドの発見:「AI × 特定ジャンル」の量産型商品が一定の需要を持つことを特定した。
- ・戦略の策定:実績のない新規参入者が避けるべき領域と、狙うべき領域を整理した。
Senior Engineer Insight
> 本件は大規模システム開発ではなく、小規模な市場調査におけるデータ駆動型アプローチの好例である。スクレイピング拡張機能による収集は迅速だが、スケーラビリティに欠ける。実戦的な分析においては、正規表現を用いた前処理の重要性が示されている。データの「見た目」に惑わされず、統計的に構造を捉える姿勢は、プロダクトの意思決定において極めて重要である。