Pourquoi trouver le SIREN d’un site e-commerce est difficile

La première réaction naturelle est de chercher l’adresse IP du serveur, puis de la croiser avec une base de données d’entreprises. Cette approche ne fonctionne pas.

Sur Shopify, WooCommerce, PrestaShop Cloud ou toute autre solution SaaS, l’IP du serveur appartient à l’infrastructure de la plateforme — pas au marchand. Une boutique Shopify sur mystore.fr a la même IP que des milliers d’autres boutiques Shopify. L’IP ne vous dit rien sur l’entité légale qui exploite le site.

La deuxième approche consiste à chercher une mention textuelle du SIREN ou du SIRET sur la page. C’est plus proche de la réalité, mais insuffisant : les pages d’un site e-commerce contiennent des dizaines de codes numériques (références produit, codes postaux, numéros de TVA, codes APE, identifiants internes) qui ressemblent à un SIREN sans en être un. Un simple regex sur 9 chiffres produit des résultats inutilisables.

La méthode en 4 étapes

La méthode correcte repose sur quatre étapes successives.

Étape 1 — Vérifier le domaine de destination. Avant tout, s’assurer que l’URL analysée est bien le domaine de destination et non un alias ou un domaine parqué. Un domaine qui redirige vers un autre appartient à l’entité qui possède le domaine cible.

Étape 2 — Extraire les mentions légales et les CGV. Les mentions légales sont obligatoires pour tout site commercial français. Elles doivent contenir la raison sociale, le SIREN ou SIRET, et l’adresse du siège social. Ce sont les pages à analyser en priorité : /mentions-legales, /cgv, /legal, footer links.

Étape 3 — Identifier le SIREN par IA en écartant les faux positifs. Une fois les pages légales extraites, l’identification du SIREN nécessite de distinguer le vrai identifiant des autres codes numériques présents. Un modèle de langage entraîné sur des milliers d’exemples de mentions légales françaises identifie le SIREN avec une précision nettement supérieure à un regex simple.

Étape 4 — Croiser avec l’INPI. Le SIREN extrait doit être validé : l’entité existe-t-elle ? Est-elle active (non radiée, non en procédure collective) ? Son adresse de siège social est-elle bien en France ? Le croisement avec l’INPI ou Pappers permet de répondre à ces trois questions et de qualifier le résultat.

Pourquoi cette approche est plus fiable que les alternatives

La réalité juridique prime sur l’infrastructure technique. Le SIREN identifie l’entité légale responsable du site, pas le prestataire technique. Un marchand peut changer de CMS, d’hébergeur ou d’adresse IP sans que son SIREN change. C’est l’identifiant stable.

La localisation du siège social est vérifiée, pas supposée. Beaucoup de bases de données supposent qu’un site en .fr est une entreprise française. Le SIREN permet de confirmer que l’entité est bien immatriculée en France et de localiser son siège social réel.

Le filtre en amont élimine les entités non pertinentes. La vérification INPI permet d’écarter les entités radiées, les procédures collectives en cours et les entreprises étrangères sans établissement français — avant même de commencer la prospection.

Les faux positifs sont neutralisés. Un marchand peut déclarer un SIREN valide qui n’est pas le sien (fraude), ou afficher un numéro de TVA intracommunautaire d’une entité étrangère. Le croisement domaine → mentions légales → INPI détecte ces incohérences.

Ce que les autres process ratent — et ce que ça coûte

L’IP serveur : fausse par construction

Sur tout hébergement mutualisé ou SaaS (Shopify, WooCommerce.com, PrestaShop Cloud), l’IP appartient à la plateforme. Croiser une IP Shopify avec une base d’entreprises retourne le siège d’Automattic ou de Shopify Inc. — pas du marchand. Cette méthode produit 100% de faux positifs sur le segment SaaS.

La réputation de domaine ne dit pas qui est le vendeur

Des outils comme SimilarWeb ou Semrush fournissent des données de trafic par domaine, mais ne font pas le lien avec l’entité légale. Vous savez qu’un site existe et attire du trafic — vous ne savez pas à qui il appartient, si l’entreprise est active, ni qui est son dirigeant.

Les risques techniques de l’extraction HTML brute

Un scraping naïf des pages d’un site e-commerce extrait tout le contenu textuel : numéros de produit, codes de réduction, références logistiques, codes APE, numéros de TVA. Sans modèle d’extraction spécifique aux mentions légales françaises, le taux d’erreur est très élevé.

La porte ouverte aux scams

Sans croisement INPI, il est impossible de détecter les sites qui affichent un SIREN valide appartenant à une autre entreprise. Ce type de fraude est courant dans les marketplaces : des vendeurs malveillants utilisent le SIREN d’une entreprise connue pour paraître légitimes.

Les métriques faussesées en aval

Une base de prospection avec 20% de SIREN incorrects fausse tous les enrichissements en aval : scoring de solvabilité, cartographie des dirigeants, analyse de marché. Les erreurs d’identification se propagent dans toute la chaîne de données.

Cas d’usage : qui a besoin d’identifier le SIREN d’un site e-commerce ?

Équipes de prospection B2B

Pour construire une base de prospection à partir d’une liste de sites e-commerce, le SIREN est la clé d’enrichissement. Il permet d’accéder aux données officielles (raison sociale exacte, dirigeant, effectifs, date de création) et d’éliminer les doublons (une même entreprise peut exploiter plusieurs domaines).

Prestataires logistiques et processeurs de paiement

Avant d’intégrer un nouveau marchand, vérifier son identité légale est une étape standard de due diligence. Le SIREN permet de croiser avec les scores de solvabilité, les procédures collectives en cours et l’historique juridique de l’entreprise.

Analystes et équipes M&A

Construire un univers de cibles d’acquisition e-commerce nécessite de rattacher chaque domaine à son entité légale. Sans SIREN, il est impossible de croiser avec les données financières officielles disponibles via l’INPI ou Infogreffe.

Identifier le SIREN d’un site e-commerce avec lebot.in

Identifier les SIRENs de votre base e-commerce

Disponible en utilisation unitaire et en mode batch — avec API pour intégration dans votre CRM ou stack KYB.

Accéder à l’outil URL-to-SIREN →Parler à un expert →

Questions fréquentes

Comment trouver le SIREN d’un site web manuellement ?

Naviguez vers les mentions légales du site (lien généralement présent dans le footer). Le SIREN ou SIRET y est obligatoirement mentionné pour les entreprises françaises. Croisez ensuite ce numéro avec l’INPI ou Pappers pour vérifier l’entité. Cette méthode fonctionne sur un site unique mais n’est pas scalable.

Peut-on trouver le SIREN d’un site via son adresse IP ?

Non. L’adresse IP du serveur ne reflète pas l’identité de l’entreprise. Sur Shopify ou toute solution SaaS, l’IP appartient à l’infrastructure de la plateforme, pas au marchand. Cette méthode produit des résultats sans valeur pour identifier une entreprise.

Quelle est la différence entre SIRET et SIREN ?

Le SIREN (9 chiffres) identifie l’entreprise. Le SIRET (14 chiffres) identifie un établissement spécifique (siège, entrepôt, magasin…). Pour identifier une entreprise e-commerce, le SIREN est l’identifiant pertinent ; le SIRET est utile si vous avez besoin de localiser un établissement précis.

Que faire si un site n’a pas de mentions légales ?

L’absence de mentions légales est une infraction pour tout site commercial français. En pratique, cela peut indiquer une entité étrangère non immatriculée en France, un micro-entrepreneur négligent, ou un site fantôme. Le système lebot.in détecte cette absence et la signale — ce qui est lui-même un signal de qualification utile.

Peut-on identifier le SIREN d’une boutique Shopify ou WooCommerce ?

Oui, sous réserve que le site affiche des mentions légales. La plateforme CMS n’a aucune incidence sur la détection : qu’il s’agisse de Shopify, WooCommerce, PrestaShop ou toute autre solution, le processus analyse les pages légales du site, pas son infrastructure technique.

Nicolas Rateau, fondateur de Lebot.in

Écrit par

Nicolas Rateau

Fondateur de Lebot.in — 12 ans à prospecter des e-commerçants avant d'en construire la base de données.