Количественный разбор: что данные говорят, если их посчитать
Не пересказ тезисов — настоящие вычисления по собранным датасетам: регрессии (OLS), корреляции (Spearman/Pearson), CAGR, индекс концентрации HHI, лог-лог эластичность, измерение лага по порогам.
Скрипт: synthesis/analyze.py (numpy/scipy) по данным: годовой датасет (149 фактов), profit-pools-normalized (42 ячейки), costB-structure (8 декад), blockD-logistic-params (8 продуктов), graph-data-v3 (94 узла с маржой). Метки: подтверждает квантифицирует исправляет.
Коротко
Семь вопросов прогнаны через данные. Пять дали чистые измеренные эффекты (часть — впервые с числом). Два исправили мои прежние формулировки: расчёт концентрации прибыли был испорчен разовым убытком Insull, а «каждое поколение быстрее» подтверждается лишь частично и с оговорками. Это и есть результат настоящего счёта, а не систематизации.
метод: CAGR по абсолютным $M (1900–1950), год рождения = первый ненулевой, время до $100M — интерполяция порогов.
| Рынок | рождение | CAGR с рождения | до $100M | 1950, $M |
|---|---|---|---|---|
| Радио+ТВ | 1920 | 21.4% | ~1923 (≈3 года) | 1700 |
| Приборы/durables | ~1900 | 17.1% | 1920 | 2700 |
| Алюминий | ~1900 | 10.8% | 1941 | 250 |
| Утилиты | ~1882 | 8.6% | ≈1900 | 5300 |
| Электротранспорт | ~1888 | 0.9% | — | 350 |
Что значит: быстрее всех рос рынок, которого вообще не существовало (радио+ТВ+реклама вещания, CAGR 21%/год, до $100M за ~3 года) — это новая УСЛУГА/опыт, а не «железо». Электротранспорт (CAGR 0.9%) — рынок, который родился рано, но почти не рос и затем умер. Самая большая возможность — в новых услугах поверх инфраструктуры, не в самой технологии.
| Период | пул, $M | HHI | доля высокомаржин. | топ-сегмент |
|---|---|---|---|---|
| P2 ~1888 | 6 | 4380 | 0% | медь (55%) |
| P3 ~1902 | 49 | 1445 | 37% | оборудование (24%) |
| P4 ~1925 | 390 | 1245 | 48% | финкапитал (21%) |
| P5 ~1940 | 495 | 1266 | 34% | утилиты (24%) |
метод: HHI = Σ(доля сегмента)² ×10000; доля высокомаржинальных = сумма прибыли тира «hi» / пул. Разовый убыток Insull −$750M (1932) и убыток транспорта ИСКЛЮЧЕНЫ (иначе доля считается от около-нулевого/отрицательного знаменателя — артефакт).
Что значит: ранний пул был гипер-концентрирован в ОДНОМ коммодити (медь, 55%, HHI=4380), затем расползся по многим сегментам (HHI упал до ~1250 — деконцентрация). Доля высокомаржинальных (защищённых) сегментов выросла с 0% до ~48% в фазу формирования (P4), затем осела ~34%. То есть на старте прибыль = один защищённый ресурс; в зрелости — распределена, но защищённые узлы держат от трети до половины.
метод: ранговая корреляция Спирмена между центральностью узла (PageRank/betweenness/degree) и тиром маржи (lo/mid/hi), n=94 узла графа с размеченной маржой.
| Центральность | ρ с маржой | p |
|---|---|---|
| PageRank | −0.09 | 0.37 |
| betweenness | −0.11 | 0.28 |
| degree | −0.05 | 0.63 |
Что значит: статистической связи между «насколько узел в центре потоков» и «сколько он зарабатывает» НЕТ (все ρ около нуля, не значимы). Средний PageRank у высокомаржинальных узлов (3.74e-3) практически равен низкомаржинальным (3.72e-3). Прежний тезис «центральность ≠ маржа» теперь не утверждение, а измеренный факт: ρ≈0.
метод: линейная регрессия (OLS) доли статьи в себестоимости 1 kWh по индексу декады (1880-е…1950-е).
Что значит: доля денег за труд падала на ~2.25 п.п. каждую декаду (22%→7%), доля за капитал (амортизация + возврат на капитал) росла на ~5.38 п.п. (25%→58%). R²≈0.95 и p=0.0001 — это не «общее впечатление», а почти прямая линия: сдвиг с оплаты людей на оплату капитала шёл системно и предсказуемо.
метод: corr(реальная цена, КПД) = −0.88; лог-лог регрессия log(цена)=β·log(МВт), β=−0.34 → цена ×2^β при удвоении масштаба.
Что значит: цена 1 kWh сильно отрицательно коррелирует с КПД (−0.88) и масштабом станции (−0.70). Эластичность по масштабу −0.34: каждое удвоение средней мощности станции снижало реальную цену примерно на 21% — это «кривая обучения по масштабу». Подтверждает: удешевление дал не дешёвый уголь, а эффективность и укрупнение.
метод: год пересечения порога 50% по ряду households_electrified_pct vs средний год достижения 50% бытовыми приборами (логистика blockD).
Что значит: приборы массово пошли примерно через 12 лет после того, как половина домов получила электричество (раньше мы говорили ~9–10 — данные дают ~12). Промышленность достигла 50% электропривода уже в 1919 — на ~6 лет раньше домов. То есть промышленность вела за собой быт, а бытовые приборы ехали на готовой домашней сети с задержкой ~декада.
метод: регрессия скорости диффузии k по году изобретения (r=0.81, p=0.014, R²=0.66) и по году t50 (R²=0.06, p=0.56); сравнение средних по типам.
| Группа | ср. скорость k |
|---|---|
| Медиа/сетевые (радио, ТВ, телефон) | 0.32 |
| Бытовые «со сменой поведения» (холодильник, стиралка, пылесос, AC) | 0.18 |
Что значит и в чём я ошибался: «каждый следующий продукт быстрее» — НЕ чистый календарный тренд. Связь есть с годом ИЗОБРЕТЕНИЯ (позже изобретённое диффундирует быстрее, r=0.81), но по году выхода на рынок (t50) связь незначима (R²=0.06). Скорость сильнее определяется ТИПОМ: медиа/сетевые продукты диффундируют быстрее (k=0.32) бытовых, требующих смены поведения (k=0.18). Телефон — выброс (немонотонен из-за Депрессии). Корректный тезис: быстрее идут позже-изобретённые И медийно-сетевые продукты — не «любой поздний».
Два честных исправления (итог настоящего счёта)
1. Концентрация прибыли в прошлой версии была посчитана с разовым убытком Insull −$750M в знаменателе → бессмысленная «−64%». После исключения one-off: HHI падает 4380→1266 (деконцентрация), доля защищённых сегментов 0→48→34%.
2. «Каждое поколение быстрее» как чистый календарный закон данными НЕ подтверждается (R²=0.06 по t50). Подтверждается слабее и с оговоркой: быстрее — позже-изобретённые и медийно-сетевые. Это уточняет закон №10 синтеза.
Пределы данных
Часть рядов (себестоимость, размеры рынков) — порядковые/реконструированные → коэффициенты вроде R²=1.0 в F5 завышены, читать как порядок. Маржа размечена на 94 из 298 узлов графа (F3) — корреляция по размеченным. Профит-пулы — якорные оценки по 4 периодам (F2). Диффузия — 8 продуктов, малая выборка (F7), поэтому регрессии чувствительны к выбросам (телефон). Все числа — измеренные на собранных данных, но данные местами разрежены; направления устойчивы, точные значения — порядок. Скрипт и сырые результаты: synthesis/analyze.py, analyze-results.json.