policyengine-data
Skill PolicyEngine объясняет, откуда берутся микроданные для популяционных микросимуляций и как они проходят построение, калибровку, версионирование и выпуск. Это слой данных, а не инструкция по запуску самой симуляции и не средство диагностики конкретного расхождения score; для этих задач исходник направляет к соседним skills. Текущая архитектура называется Populace и строится вокруг единого типа Frame. Пакеты пространства populace выступают операторами над Frame, устанавливаются отдельными shard-дистрибутивами, а metapackage populace фиксирует согласованную constellation-версию. Такой разрез отделяет работу с представлением записей, условной структурой и весами, не заставляя каждый аналитический сценарий устанавливать весь стек. В certified bundle используются именованные наборы данных. populace_us_2024 — американский default, компактная sparse-сборка примерно на 57 тысяч домохозяйств, откалиброванная по большому набору административных целей. populace_us_2024_acs_local — отдельная локальная сборка примерно на 1,6 миллиона домохозяйств с географическими колонками ACS; её нужно загружать по имени. populace_uk_2023 — британский default из Populace с FRS и WAS, опубликованный в закрытом репозитории Hugging Face и требующий HUGGING_FACE_TOKEN. Сертифицированный managed-путь pe.* разрешает dataset через bundle manifest и знает build, тогда как голый Microsimulation() в country package может ссылаться на более ранний build того же семейства. Для воспроизводимого результата следует фиксировать не только имя семейства, но и поверхность загрузки и manifest build. Для local-area анализа Populace предлагает одну национальную таблицу, отфильтрованную по географии, а не отдельный файл для каждого штата или округа. Локальная ACS-сборка содержит state FIPS, congressional district GEOID, county и другие признаки; Нью-Йорк в таком подходе является фильтром строк, а не самостоятельным dataset. Живые calibration diagnostics доступны без авторизации через calibration-diagnostics.vercel.app и показывают, какие административные цели текущий выпуск достигает или пропускает. Новую работу с данными следует направлять в репозиторий populace. policyengine-us-data помечен в исходном skill как архивный с 2026-07-02: его старые CPS/IRS-PUF и per-area H5-пути не являются текущим местом для PR. policyengine-uk-data остаётся входным pipeline для enhanced FRS с признаками, дополненными из WAS. Внутри data layer skill сохраняет важные понятия старого стека, потому что их механика продолжает жить в Populace. Conditional imputation использует quantile regression forests: модель оценивает условное распределение P(y|x), а не только среднее, и качество проверяется quantile loss. В американском примере компоненты налоговых доходов переносятся с IRS PUF на CPS, в британском — признаки wealth с WAS на FRS. Calibration решает другую задачу: настраивает веса так, чтобы взвешенные суммы признаков приближались к известным population targets. В Populace оператор populace-calibrate учитывает неопределённость и standard errors и является источником calibrated weights; imputation отвечает за support, а calibration — за representation. Для компактного US default применяется L0 sparsity через Hard-Concrete gates: веса стремятся к нулю, а часть записей исключается. Это ускоряет расчёты и объясняет sparse-57k, но создаёт ограничение: переменная, которой нет среди calibration targets, может быть плохо представлена после pruning, и реформа на такой базе даст подозрительно маленький результат. В этом случае сначала нужно проверить calibration diagnostics и понять, не нужна ли более плотная сборка. CI fast mode должен уменьшать размер выборки, число деревьев или эпох, но не отключать validation и не менять алгоритм. Предрелизные сборки также могут публиковать staging telemetry в progress.json и events.ndjson. Skill полезен тем, кто проверяет происхождение dataset, выбирает правильную поверхность загрузки или объясняет, почему калиброванная sparse-популяция даёт иной результат, чем плотная или устаревшая сборка.
Для чего подходит
- Разбор data layer PolicyEngine
- Работа с калибровкой и survey weights
- Проверка версий и release gates датасетов
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/PolicyEngine/policyengine-claude/tree/main/skills/policyengine-data