Навыки spark-optimization
📦

spark-optimization

Ревизия содержимого r1 Безопасно ⚙️ Внешние команды🌐 Доступ к сети

Оптимизация заданий Apache Spark

Медленные задания Spark расходуют время кластера и скрывают проблемы масштабирования. Этот навык помогает настраивать партиционирование, кэширование, shuffle и память для пайплайнов PySpark.

Поддерживает: Claude Codex Code(CC)
🥉 78 Бронза

Установить с помощью моего Агента

Скопируйте этот запрос в своего Агента. Он содержит каноническую страницу Skill и манифест.

Запрос агента
Review the Skillstore skill "spark-optimization" from https://skillstore.io/skills/sickn33-spark-optimization.md and its manifest at https://skillstore.io/api/skills/sickn33-spark-optimization/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.

Ваш Агент по-прежнему должен показать план и запросить все подтверждения, требуемые политикой безопасности.

Ресурсы для AI-агентов

Используйте эти ссылки, когда AI-агенту, crawler или script нужен чистый контекст вместо полной страницы.

Протестировать

Использование «spark-optimization». Ежедневная агрегация PySpark стала медленной после удвоения входного объема.

Ожидаемый результат:

  • Вероятные узкие места включают рост shuffle, слишком мелкие партиции и возможный перекос данных.
  • Рекомендуемые проверки включают размер shuffle в Spark UI, spilled bytes, количество партиций и разброс длительности стадий.
  • Предлагаемые действия включают AQE, partition pruning, предварительную агрегацию и проверку относительно предыдущего результата.

Использование «spark-optimization». Join между большой fact table и небольшой dimension table завершается по таймауту.

Ожидаемый результат:

  • Навык сравнил бы варианты broadcast join, sort-merge join и bucket join.
  • Он проверил бы размер dimension, память executor, ключи с перекосом и метрики shuffle перед рекомендацией стратегии.

Использование «spark-optimization». Команде нужен переиспользуемый чек-лист настройки Spark для release reviews.

Ожидаемый результат:

  • Результат охватил бы размер партиций, правила кэширования, настройки памяти, выбор формата файлов и метрики мониторинга.
  • Он включал бы шаги проверки runtime, объема shuffle, spills и корректности результатов.

Аудит безопасности

Безопасно

The static alerts are false positives caused by Markdown code fences, inline formatting, PySpark examples, documentation links, and Spark API names. No evidence found for prompt injection, data exfiltration intent, unauthorized network calls, or command execution in SKILL.md.

1
Просканировано файлов
428
Проанализировано строк
0
Пункты проверки
0
Ложные срабатывания проигнорированы
Последний завершенный статический и семантический аудит не обнаружил подтвержденных проблем безопасности. Это не доказывает отсутствие побочных эффектов у навыка.
Поделиться и цитировать этот отчет

Делитесь версионным отчетом об оценке, нейтральным значком, встраиваемой карточкой и цитатами. Skillstore публикует доказательства, не решая, безопасен ли этот Skill.

Открыть версионный отчет
Оценка безопасности

Копировать ссылку на отчёт

https://skillstore.io/skills/sickn33-spark-optimization/audits/4?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report

Значок Markdown

[![Skillstore security assessment](https://skillstore.io/badges/skills/sickn33-spark-optimization/security.svg)](https://skillstore.io/skills/sickn33-spark-optimization?utm_source=security_passport_badge)

Значок HTML

<a href="https://skillstore.io/skills/sickn33-spark-optimization?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-spark-optimization/security.svg" alt="Skillstore security assessment" loading="lazy"></a>

Встраиваемая карточка

<iframe src="https://skillstore.io/embed/skills/sickn33-spark-optimization.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>
Академические ссылки (APA · BibTeX · CFF)

Цитата APA

sickn33. (2026). spark-optimization security audit report (audit version 4) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-spark-optimization/audits/4

Цитата BibTeX

@techreport{sickn33-sickn33-spark-optimization-2026, author = {sickn33}, title = {spark-optimization security audit report (audit version 4)}, institution = {Skillstore}, year = {2026}, number = {4}, url = {https://skillstore.io/skills/sickn33-spark-optimization/audits/4}, note = {Author version unspecified} }

CITATION.cff

cff-version: 1.2.0 message: "If you use this Skill, cite its author and this versioned security audit report." title: "spark-optimization security audit report (audit version 4)" version: "unspecified" type: report authors: - name: "sickn33" date-released: "2026-07-07" url: "https://skillstore.io/skills/sickn33-spark-optimization/audits/4" identifiers: - type: other value: "skillstore:sickn33-spark-optimization:audit:4" description: "Skillstore immutable audit report identifier"

Сравнить варианты

2 устанавливаемых вариантов

Навык каждого автора остаётся отдельным устанавливаемым вариантом. Рекомендуемый вариант ранжируется по данным Skillstore.

Почему этот вариант первый

Самая высокая оценка Skillstore
wshobson Рекомендуется

wshobson-spark-optimization

Оценка Skillstore 79
Достоверность доказательств Высокий
Использование в Skillstore 16
Обновлено

2026-09-09

sickn33 Текущий

sickn33-spark-optimization

Оценка Skillstore 78
Достоверность доказательств Высокий
Использование в Skillstore 17
Обновлено

2026-09-09

Оценка Skillstore

Почему такая оценка Достоверность доказательств: Высокий
55
Архитектура
85
Сопровождаемость
87
Контент
70
Сообщество
83
Соответствие спецификации

Что вы можете построить

Сократить время выполнения batch-пайплайна

Проверить медленное ETL-задание и определить улучшения в партиционировании, shuffle, кэшировании и формате файлов.

Настроить использование ресурсов кластера

Спланировать память executor, cores, shuffle partitions и настройки AQE для растущей рабочей нагрузки Spark.

Диагностировать перекос данных

Использовать метрики Spark и проверки партиций, чтобы найти перекос и выбрать стратегии salting или broadcast.

Попробуйте эти промпты

Найти базовые узкие места
Проверь мое медленное задание Spark. Объясни вероятные узкие места и дай базовые проверки партиций, кэша и shuffle, которые я могу безопасно применить.
Сократить shuffle
Настрой эту трансформацию PySpark, чтобы уменьшить количество shuffle. Учитывай broadcast joins, salting, predicate pushdown и размер партиций.
Создать чек-лист настройки
Создай чек-лист производительности Spark для этого пайплайна. Включи executor memory, AQE, file format, caching, skew detection и шаги validation.
Спланировать production-оптимизацию
Проанализируй эту production-нагрузку Spark. Рекомендуй план настройки для joins, storage layout, Delta optimization, monitoring metrics и rollback checks.

Лучшие практики

  • Начинайте с данных из Spark UI перед изменением значений конфигурации.
  • Меняйте по одной переменной настройки за раз и сравнивайте runtime, spills и размер shuffle.
  • Проверяйте корректность результата после repartitioning, caching или изменения стратегии join.

Избегать

  • Использование collect или count на больших данных для быстрых проверок.
  • Broadcasting таблиц без проверки размера и памяти executor.
  • Добавление cache-вызовов без повторного использования или очистки.

Часто задаваемые вопросы

Может ли этот навык настраивать задания Databricks?
Да. Рекомендации охватывают паттерны Spark, применимые к Databricks, включая темы оптимизации Delta.
Запускает ли он бенчмарки автоматически?
Нет. Он предоставляет рекомендации по настройке и шаги проверки, но пользователи должны запускать задания и собирать метрики.
Какие входные данные улучшают рекомендации?
Предоставьте код задания, размеры данных, количество партиций, настройки кластера, метрики Spark UI и известные сбои.
Может ли он помочь с перекосом данных?
Да. Он объясняет обнаружение перекоса, обработку skew в AQE, salting и альтернативы broadcast join.
Он предназначен только для PySpark?
Большинство примеров используют PySpark, но концепции настройки также применимы к Scala Spark и Spark SQL.
Изменяет ли он production-данные?
Нет. Навык носит рекомендательный характер. Пользователи сами решают, применять ли рекомендованные изменения кода или конфигурации.

Сведения для разработчиков

Автор

sickn33

Лицензия

MIT

Ревизия Skillstore

r1

Примечание о версии

Автор не указал версию.

Ссылка

9f814fc6a43fd99946f2da5e0df231c65a38bc76

Актуальность поддержки

22.07.2026

Использование

11 загрузок · 174 просмотров

Структура файлов

📄 SKILL.md

Больше от sickn33

Показать все
📦

content-creator

88

Создание маркетингового контента в едином стиле бренда

Маркетинговым командам нужен контент, который остается согласованным во всех каналах. Этот навык помогает планировать, писать, анализировать и оптимизировать контент с учетом голоса бренда и SEO.

Письмо и контент Просмотр
📦

prompt-engineering-patterns

85

Улучшайте LLM-промпты с помощью проверенных паттернов

Непоследовательные промпты тратят время и снижают доверие к результатам AI. Этот навык помогает проектировать промпты с использованием переиспользуемых паттернов, примеров, этапов оценки и рабочих процессов оптимизации.

Продуктивность Просмотр
📦

senior-architect

81

Проектируйте масштабируемые архитектуры ПО

Архитектурные решения сложно сравнивать для веб-, мобильных, backend- и облачных систем. Этот навык предоставляет структурированные руководства и локальные скрипты-заготовки для отчетов, анализа зависимостей и документирования компромиссов.

Кодинг и разработка Просмотр
📦

senior-fullstack

81

Создавайте fullstack-приложения с senior-паттернами

Командам нужны единые рекомендации по настройке, архитектуре и ревью для современных веб-приложений. Этот skill предоставляет scaffolders, справочные материалы по рабочим процессам и quality prompts для проектов на React, Next.js, Node.js, GraphQL и PostgreSQL.

Кодинг и разработка Просмотр
📦

product-manager-toolkit

80

Приоритизируйте продуктовую работу с помощью исследовательских инсайтов

Продуктовым командам нужны более быстрые способы ранжировать функции, обобщать интервью и документировать решения. Этот навык предоставляет RICE-оценку, анализ интервью и шаблоны PRD для структурированного планирования.

Продуктивность Просмотр
Показать все
📦

senior-data-engineer

81

Создание производственных конвейеров данных

от alirezarezvani

Командам данных в production нужны надежные шаблоны для конвейеров, проверок качества и оркестрации. Этот навык помогает с архитектурой, созданием каркасов и практиками DataOps для современных стеков данных.

Данные и аналитика Просмотр
📦

parquet-optimization

80

Оптимизация производительности Parquet в Rust

от EmilLindfors

Конвейеры Parquet могут неэффективно расходовать хранилище и память при использовании настроек по умолчанию. Этот навык анализирует чтение и запись Parquet в Rust, а затем предлагает улучшения сжатия, размеров, проекции и фильтрации.

Данные и аналитика Просмотр
📦

datafusion-query-advisor

80

Оптимизация запросов DataFusion

от EmilLindfors

Медленные запросы DataFusion могут впустую расходовать вычислительные ресурсы и скрывать простые проблемы в плане выполнения. Этот навык анализирует шаблоны SQL и DataFrame, а затем предлагает конкретные улучшения производительности.

Данные и аналитика Просмотр
📦

dask

76

Масштабирование рабочих процессов обработки данных Python с помощью Dask

от davila7

Большие наборы данных Python часто превышают объем памяти или выполняются слишком медленно в одном процессе. Этот навык помогает Claude, Codex и Claude Code проектировать рабочие процессы Dask.

Данные и аналитика Просмотр
📦

polars

75

Ускорьте рабочие процессы с Polars DataFrame

от davila7

Командам по работе с данными нужны быстрые рекомендации при создании пайплайнов Polars и миграции с pandas. Этот навык предоставляет краткие паттерны для выражений, ленивых запросов, ввода-вывода, соединений и настройки производительности.

Данные и аналитика Просмотр