exploratory-data-analysis
Навык K-Dense Inc. задаёт безопасный и ограниченный workflow для локального exploratory data analysis перед моделированием или подтверждающими выводами. Он предназначен для авторизованных локальных данных и строит детерминированные агрегированные отчёты в ограниченном объёме. Такой анализ помогает увидеть структуру файла, пропуски, возможные утечки, выбросы и чувствительность преобразований, но не сертифицирует набор, не устанавливает научный смысл полей и не превращает исследовательский сигнал в причинный или клинический вывод. Основной автоматизированный контур включает CSV, TSV и строгий JSON. Для таблиц предусмотрены профилирование прямоугольной схемы, анализ пропусков, групп и разбиений, распределений, выбросов и чувствительности преобразований. Дополнительные инспекторы охватывают NPY/NPZ, HDF5, FASTA/FASTQ и метаданные распространённых изображений; специализированные форматы вроде PDB, BAM, VCF, DICOM, Parquet, Excel и других доменных контейнеров остаются reference-only и требуют отдельного проверенного инструментария. Неизвестный формат должен завершаться отказом, а не эвристическим чтением. Безопасность входа — часть назначения навыка. Он требует регулярный файл внутри явно разрешённого корня, отклоняет URL, пути с .., symlink, специальные файлы, архивы и источники вне корня, ограничивает размер и объём отчёта, а также не делает сетевых вызовов. Содержимое ячеек, заголовков, последовательностей и metadata считается недоверенным: его нельзя выполнять, передавать в shell, интерпретировать как инструкции, использовать для макросов, dynamic evaluation, pickle/joblib/dill или загрузки моделей. Сырые строки, прямые идентификаторы и полные пути не должны попадать в общий отчёт. Рекомендуемый порядок начинается с capability manifest, который подтверждает формат и границы файла. Затем выбирается самый узкий анализатор: общий EDA-отчёт, табличный профиль, аудит missingness/leakage или проверка distribution/outlier/transformation sensitivity. После этого создаётся report scaffold, куда добавляются наблюдаемые агрегаты и provenance. Для интерпретации до запуска следует зафиксировать словарь данных, единицу наблюдения и иерархию образцов, смысл пропусков, границы train/validation/test, временную или групповую структуру, а также какие вопросы были заданы заранее, а какие появились при просмотре. Методика специально не скрывает неопределённость. Пропуск, структурное отсутствие, non-detect, below-LOQ, saturation, failure и настоящий ноль нужно различать; автоматическая импутация, удаление выбросов, фильтрация, нормализация и batch correction запрещены. Для числовых признаков полезно сопоставлять mean/SD с median/IQR/MAD и показывать влияние флагов выбросов без удаления строк. Параметры преобразований следует обосновывать и обучать только на тренировочной части. Повторные измерения, пары, кластеры, партии и субъекты нельзя считать независимыми строками. Практическая ценность карточки — в воспроизводимой диагностике перед дальнейшей работой: она помогает обнаружить проблему качества или split leakage и сохранить отдельный derived report, не переписывая raw data. Ограничение остаётся принципиальным: bounded prefix или sample не доказывает полную валидацию, диагностический флаг не равен доказанному bias/leakage, а EDA не даёт причинных, подтверждающих или клинических утверждений. Для формата и научного контекста нужно заранее подтвердить подходящий reference и указать область реально просканированных данных.
Для чего подходит
- Профилирование CSV, TSV и JSON
- Проверка пропусков, утечек и выбросов
- Подготовка воспроизводимого EDA-отчёта
Установка
Сначала прочитайте SKILL.md и scripts в исходном репозитории. Затем выполните команду в каталоге проекта:
npx skills add https://github.com/K-Dense-AI/scientific-agent-skills/tree/main/skills/exploratory-data-analysis