← Все материалы П49

Количественный разбор: что данные говорят, если их посчитать

Не пересказ тезисов — настоящие вычисления по собранным датасетам: регрессии (OLS), корреляции (Spearman/Pearson), CAGR, индекс концентрации HHI, лог-лог эластичность, измерение лага по порогам.

Скрипт: synthesis/analyze.py (numpy/scipy) по данным: годовой датасет (149 фактов), profit-pools-normalized (42 ячейки), costB-structure (8 декад), blockD-logistic-params (8 продуктов), graph-data-v3 (94 узла с маржой). Метки: подтверждает квантифицирует исправляет.

Коротко

Семь вопросов прогнаны через данные. Пять дали чистые измеренные эффекты (часть — впервые с числом). Два исправили мои прежние формулировки: расчёт концентрации прибыли был испорчен разовым убытком Insull, а «каждое поколение быстрее» подтверждается лишь частично и с оговорками. Это и есть результат настоящего счёта, а не систематизации.

квантифицируетF1 · Новые рынки росли ×34, и самые быстрые — родившиеся «из нуля»
7.3% /год CAGR суммарно (×34 за 50 лет)

метод: CAGR по абсолютным $M (1900–1950), год рождения = первый ненулевой, время до $100M — интерполяция порогов.

РынокрождениеCAGR с рождениядо $100M1950, $M
Радио+ТВ192021.4%~1923 (≈3 года)1700
Приборы/durables~190017.1%19202700
Алюминий~190010.8%1941250
Утилиты~18828.6%≈19005300
Электротранспорт~18880.9%350

Что значит: быстрее всех рос рынок, которого вообще не существовало (радио+ТВ+реклама вещания, CAGR 21%/год, до $100M за ~3 года) — это новая УСЛУГА/опыт, а не «железо». Электротранспорт (CAGR 0.9%) — рынок, который родился рано, но почти не рос и затем умер. Самая большая возможность — в новых услугах поверх инфраструктуры, не в самой технологии.

исправляетF2 · Пул прибыли деконцентрировался; защищённые сегменты держат ⅓–½
Периодпул, $MHHIдоля высокомаржин.топ-сегмент
P2 ~1888643800%медь (55%)
P3 ~190249144537%оборудование (24%)
P4 ~1925390124548%финкапитал (21%)
P5 ~1940495126634%утилиты (24%)

метод: HHI = Σ(доля сегмента)² ×10000; доля высокомаржинальных = сумма прибыли тира «hi» / пул. Разовый убыток Insull −$750M (1932) и убыток транспорта ИСКЛЮЧЕНЫ (иначе доля считается от около-нулевого/отрицательного знаменателя — артефакт).

Что значит: ранний пул был гипер-концентрирован в ОДНОМ коммодити (медь, 55%, HHI=4380), затем расползся по многим сегментам (HHI упал до ~1250 — деконцентрация). Доля высокомаржинальных (защищённых) сегментов выросла с 0% до ~48% в фазу формирования (P4), затем осела ~34%. То есть на старте прибыль = один защищённый ресурс; в зрелости — распределена, но защищённые узлы держат от трети до половины.

⚠ Исправление: в прошлой версии я давал «доля hi P2→P5 = −64%» — это была ошибка от того, что разовый убыток Insull −$750M входил в сумму. После его исключения картина корректна (0→37→48→34%).
подтверждаетF3 · Центральность и маржа НЕ связаны — теперь с коэффициентом
ρ = −0.09 Spearman(PageRank, маржа-тир), p=0.37 — не отличимо от нуля

метод: ранговая корреляция Спирмена между центральностью узла (PageRank/betweenness/degree) и тиром маржи (lo/mid/hi), n=94 узла графа с размеченной маржой.

Центральностьρ с маржойp
PageRank−0.090.37
betweenness−0.110.28
degree−0.050.63

Что значит: статистической связи между «насколько узел в центре потоков» и «сколько он зарабатывает» НЕТ (все ρ около нуля, не значимы). Средний PageRank у высокомаржинальных узлов (3.74e-3) практически равен низкомаржинальным (3.72e-3). Прежний тезис «центральность ≠ маржа» теперь не утверждение, а измеренный факт: ρ≈0.

квантифицируетF4 · Сдвиг труд→капитал — устойчивый тренд, почти без шума
труд −2.25 · капитал +5.38 п.п. за декаду (R²=0.95 / 0.94, p=0.0001)

метод: линейная регрессия (OLS) доли статьи в себестоимости 1 kWh по индексу декады (1880-е…1950-е).

Что значит: доля денег за труд падала на ~2.25 п.п. каждую декаду (22%→7%), доля за капитал (амортизация + возврат на капитал) росла на ~5.38 п.п. (25%→58%). R²≈0.95 и p=0.0001 — это не «общее впечатление», а почти прямая линия: сдвиг с оплаты людей на оплату капитала шёл системно и предсказуемо.

квантифицируетF5 · Цену уронили масштаб и КПД; масштаб даёт −21% за удвоение
−21% цены за каждое удвоение мощности станции (эластичность −0.34)

метод: corr(реальная цена, КПД) = −0.88; лог-лог регрессия log(цена)=β·log(МВт), β=−0.34 → цена ×2^β при удвоении масштаба.

Что значит: цена 1 kWh сильно отрицательно коррелирует с КПД (−0.88) и масштабом станции (−0.70). Эластичность по масштабу −0.34: каждое удвоение средней мощности станции снижало реальную цену примерно на 21% — это «кривая обучения по масштабу». Подтверждает: удешевление дал не дешёвый уголь, а эффективность и укрупнение.

⚠ Честно: ряды реальной цены и расхода угля частично восстановлены из КПД, поэтому R²≈1.0 завышен; число −21%/удвоение — сводная оценка порядка, не прецизионный коэффициент.
квантифицируетF6 · Лаг «сеть → приборы» = ~12 лет (точнее, чем прежние ~9–10)
+12 лет от электрификации домов 50% (1925) до среднего t50 приборов (1937)

метод: год пересечения порога 50% по ряду households_electrified_pct vs средний год достижения 50% бытовыми приборами (логистика blockD).

Что значит: приборы массово пошли примерно через 12 лет после того, как половина домов получила электричество (раньше мы говорили ~9–10 — данные дают ~12). Промышленность достигла 50% электропривода уже в 1919 — на ~6 лет раньше домов. То есть промышленность вела за собой быт, а бытовые приборы ехали на готовой домашней сети с задержкой ~декада.

исправляетF7 · «Каждое поколение быстрее» — подтверждается лишь частично
r=0.81 (по году изобретения) но R²=0.06 по году t50; сильнее зависит от ТИПА

метод: регрессия скорости диффузии k по году изобретения (r=0.81, p=0.014, R²=0.66) и по году t50 (R²=0.06, p=0.56); сравнение средних по типам.

Группаср. скорость k
Медиа/сетевые (радио, ТВ, телефон)0.32
Бытовые «со сменой поведения» (холодильник, стиралка, пылесос, AC)0.18

Что значит и в чём я ошибался: «каждый следующий продукт быстрее» — НЕ чистый календарный тренд. Связь есть с годом ИЗОБРЕТЕНИЯ (позже изобретённое диффундирует быстрее, r=0.81), но по году выхода на рынок (t50) связь незначима (R²=0.06). Скорость сильнее определяется ТИПОМ: медиа/сетевые продукты диффундируют быстрее (k=0.32) бытовых, требующих смены поведения (k=0.18). Телефон — выброс (немонотонен из-за Депрессии). Корректный тезис: быстрее идут позже-изобретённые И медийно-сетевые продукты — не «любой поздний».

Два честных исправления (итог настоящего счёта)

1. Концентрация прибыли в прошлой версии была посчитана с разовым убытком Insull −$750M в знаменателе → бессмысленная «−64%». После исключения one-off: HHI падает 4380→1266 (деконцентрация), доля защищённых сегментов 0→48→34%.
2. «Каждое поколение быстрее» как чистый календарный закон данными НЕ подтверждается (R²=0.06 по t50). Подтверждается слабее и с оговоркой: быстрее — позже-изобретённые и медийно-сетевые. Это уточняет закон №10 синтеза.

Пределы данных

Часть рядов (себестоимость, размеры рынков) — порядковые/реконструированные → коэффициенты вроде R²=1.0 в F5 завышены, читать как порядок. Маржа размечена на 94 из 298 узлов графа (F3) — корреляция по размеченным. Профит-пулы — якорные оценки по 4 периодам (F2). Диффузия — 8 продуктов, малая выборка (F7), поэтому регрессии чувствительны к выбросам (телефон). Все числа — измеренные на собранных данных, но данные местами разрежены; направления устойчивы, точные значения — порядок. Скрипт и сырые результаты: synthesis/analyze.py, analyze-results.json.