Files
ja4-platform/shared/clickhouse
Jacquin Antoine 36b5065a0a feat(e2e): add multi-IP endpoint architecture with dedicated traffic VM
Replace single-service-per-endpoint with all-ips mode running nginx, apache,
and hitch+varnish simultaneously on 3 dedicated IPs per VM (eth1 alias IPs).
Add a dedicated traffic VM with curl-impersonate for realistic TLS fingerprints,
parallelized traffic generation, and paired SNI_HOSTS/TARGET_IPS lists for
per-VM per-service hostname identification (e.g. rocky9-nginx-platform.test).

Key changes:
- run-tests-vm.sh: add setup_all_ips(), IP-specific Listen/bind directives
  with reset-before-apply pattern, graceful service availability checks
- run-e2e-test.sh: traffic VM architecture, all-ips mode, eth1 network,
  paired IP/SNI lists, updated cleanup for alias IPs
- generate-traffic.sh: parallel background jobs, curl-impersonate detection,
  auto source interface detection via ip route get, Host header in HTTP traffic
- Vagrantfile: add traffic VM with provision-traffic.sh
- provision-traffic.sh: install curl-impersonate and httpx for traffic gen
- test-rpm.sh: multi-interface TC check, updated ja4ebpf config
- clickhouse-init.sh: load CSV stubs for Anubis/bot-networks dictionaries
- Remove obsolete correlator/sentinel/mod-reqin-log docs
- Add h2_settings_ack column to http_logs schema
- Upgrade Go toolchain to 1.25.0

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-16 14:25:24 +02:00
..

Schéma ClickHouse — ja4-platform

Ce répertoire contient les 13 fichiers SQL définissant le schéma complet de la plateforme. Le schéma utilise un patron double-base :

  • ja4_logs — ingestion brute et logs HTTP parsés
  • ja4_processing — agrégations, ML, vues, dictionnaires, audit

Les noms de base sont configurables via variables d'environnement (CLICKHOUSE_DB_LOGS, CLICKHOUSE_DB_PROCESSING).

Fichiers SQL

Appliquer dans l'ordre numérique :

Fichier Contenu
00_database.sql Création des bases ja4_logs et ja4_processing
01_raw_tables.sql Table d'ingestion http_logs_raw
02_dictionaries.sql Dictionnaire dict_iplocate_asn, tables ref_bot_networks, bot_ip, bot_ja4
03_anubis_tables.sql Tables de règles Anubis (anubis_ip_rules, anubis_asn_rules) et dictionnaires (dict_anubis_ip, dict_anubis_asn)
04_mv_http_logs.sql Table http_logs + vue matérialisée mv_http_logs (parse JSON + enrichissement Anubis IP→ASN)
05_aggregation_tables.sql Dictionnaires de réputation (dict_bot_ip, dict_bot_ja4, dict_browser_ja4, dict_asn_reputation) + tables d'agrégation + MVs
06_ml_tables.sql Tables ML (ml_detected_anomalies, ml_all_scores) + vue view_ip_recurrence
07_ai_features_view.sql Vue view_ai_features_1h (~65+ features ML)
08_users.sql Utilisateurs data_writer et analyst avec permissions
09_audit_table.sql Table audit_logs pour le journal d'audit SOC
10_perf_indexes.sql Index secondaires et projections de performance
11_views.sql Vues dashboard (entités, user-agents, force brute, rotation JA4, cascade)
12_thesis_features.sql Tables d'agrégation thèse (§5) + vue view_thesis_features_1h

Déploiement

Méthode recommandée

Utiliser deploy_schema.sh qui applique les 13 fichiers avec substitution automatique des noms de base :

./deploy_schema.sh

# Ou avec configuration personnalisée :
CLICKHOUSE_DB_LOGS=my_logs \
CLICKHOUSE_DB_PROCESSING=my_proc \
CLICKHOUSE_HOST=clickhouse-server \
CLICKHOUSE_PASSWORD='secret' \
  ./deploy_schema.sh

Application manuelle

for f in 0*.sql 1*.sql; do
    clickhouse-client --multiquery < "$f"
done

Prérequis

  • ClickHouse 24.8+ (support deduplicate_merge_projection_mode)
  • Fichiers CSV dans /var/lib/clickhouse/user_files/ :
    • iplocate-ip-to-asn.csv — correspondance IP→ASN (~714K entrées)
    • bot_ip.csv — préfixes IP de bots connus (~3,5K CIDR)
    • bot_ja4.csv — empreintes JA4 de bots (~31 entrées)
    • browser_ja4.csv — empreintes JA4 de navigateurs (~1,2K entrées)
    • asn_reputation.csv — labels de réputation ASN (~82K entrées)
  • Mots de passe Anubis : remplacer CHANGE_ME dans 03_anubis_tables.sql

Notes

  • Toutes les migrations sont idempotentes (IF NOT EXISTS / CREATE OR REPLACE).
  • 04_mv_http_logs.sql est la version canonique de la vue matérialisée.
  • Les références inter-bases existent : les MVs dans ja4_processing lisent depuis ja4_logs.http_logs.
  • Documentation complète : docs/database/schema.md et docs/database/migrations.md.