Analyse
Bases antispam communautaires : des millions de numéros, mais quelle protection réelle ?
Les chiffres impressionnants associés aux applications antispam ne disent pas toujours combien de numéros ont réellement été identifiés un par un. L’analyse d’un système français permet de mesurer l’écart entre la taille affichée d’une protection et l’information nouvelle apportée par sa base communautaire.
Quelques centaines de règles peuvent représenter des millions de numéros
Une règle fondée sur une plage ne correspond pas à un seul numéro. Elle couvre en une fois tous les numéros compris entre ses bornes.
- Règle
- 01 62 xx xx xx
- Premier numéro
- 01 62 00 00 00
- Dernier numéro
- 01 62 99 99 99
Cette seule règle représente ainsi 1 million de numéros théoriques.
Les 22 plages correspondant aux numéros polyvalents vérifiés, ou NPV, définies par l’ARCEP représentent à elles seules 13 000 000 de numéros. Le système étudié ajoute 727 règles couvrant des tranches attribuées à certains opérateurs, soit 2 302 000 numéros.
Une partie de ces plages se chevauche. Après suppression des doublons, les deux mécanismes couvrent environ 14 568 000 numéros théoriques uniques, avant même de prendre en compte la base communautaire.
À distinguer : des millions de numéros peuvent être couverts grâce à quelques centaines de règles sans que chacun d’eux ait été signalé individuellement. Le titre du document source évoque 16 millions de numéros bloqués, mais son calcul détaillé établit environ 14 568 000 numéros théoriques uniques et ne permet pas d’expliquer précisément l’écart. Le chiffre de 16 millions n’est donc pas retenu comme résultat calculé.
Une base communautaire de 77 393 entrées
Le fichier communautaire analysé contient exactement 77 393 entrées. Chacune a été comparée avec les plages déjà filtrées.
72 326 entrées sont déjà comprises dans une plage ARCEP ou une plage opérateur existante, soit 93,45 % de la base communautaire. Il reste donc 5 067 numéros en dehors de ces mécanismes.
Plus de neuf entrées communautaires sur dix n’augmentent donc pas la couverture du filtrage : le numéro aurait déjà été reconnu par une règle plus générale. Cela ne signifie pas que les signalements sont faux, mais qu’ils sont redondants du point de vue du blocage.
Le parcours chiffré de la base communautaire
La réduction ci-dessous porte uniquement sur les 77 393 entrées communautaires. Elle ne décrit pas une réduction de millions de numéros à 13.
- 77 393entrées communautaires
- 72 326déjà couvertes
- 5 067restantes
- 4 188rattachées à MAJNUM
- 879à analyser
- 13numéros français ordinaires inexpliqués
Que deviennent les 5 067 numéros restants ?
Ces 5 067 numéros ont ensuite été comparés à MAJNUM, le fichier officiel de l’ARCEP recensant les ressources de numérotation attribuées aux opérateurs.
Cette comparaison permet d’en rattacher 4 188 à des plages officielles MAJNUM. Ils n’étaient pas nécessairement déjà bloqués par le système, mais appartiennent à des ressources de numérotation officiellement identifiables.
Il reste alors 879 entrées. Leur étude détaillée montre qu’elles sont très loin de constituer 879 nouveaux numéros français indésirables.
| Nature des entrées | Nombre |
|---|---|
| Numéros internationaux | 562 |
| Numéros ou codes courts | 201 |
| Numéros français mal normalisés retrouvés dans MAJNUM | 29 |
| Numéros M2M officiels en 0700 | 4 |
| Ressources retrouvées dans GELNUM | 33 |
| Formats anormaux ou problématiques | 37 |
| Numéros français ordinaires encore inexpliqués | 13 |
| Total | 879 |
Sur 879 entrées, seulement 13 numéros français ordinaires restent inexpliqués
Le fichier GELNUM de l’ARCEP a notamment permis d’expliquer 30 numéros en 06 44 63... et 3 numéros en 09 72 03 5.... Ces plages ne figurent plus dans MAJNUM parce qu’elles sont actuellement gelées, mais elles restent identifiées dans les données officielles.
Au terme de l’analyse, le véritable reliquat est donc de 13 numéros français ordinaires. Même parmi ces 13 cas, certains présentent des structures pouvant correspondre à des valeurs artificielles ou de test. Il serait donc incorrect de les considérer automatiquement comme 13 protections communautaires utiles et certaines.
Ce que montre réellement cette analyse
Le résultat n’est pas que « 16 millions deviennent 13 ». Ce serait faux : les millions correspondent à une couverture théorique obtenue par des plages, tandis que les 13 proviennent exclusivement de l’analyse des 77 393 entrées communautaires.
En revanche, le constat est précis : sur 77 393 entrées communautaires, 72 326 sont déjà couvertes par des règles existantes. Lorsque les 5 067 restantes sont examinées avec les données officielles de numérotation et leur format réel, il ne subsiste que 13 numéros français ordinaires non expliqués.
L’écart entre la taille brute de la base et l’information réellement nouvelle est donc considérable.
Une base communautaire reste-t-elle utile ?
Dans certains cas, oui. Un numéro nouvellement utilisé peut être signalé avant qu’une règle générale permette de l’identifier. Une base communautaire peut donc avoir un intérêt ponctuel pour détecter rapidement un numéro isolé.
Mais continuer à ajouter des numéros appartenant à des plages déjà filtrées augmente la taille de la base sans augmenter la protection réelle dans les mêmes proportions. 50 000 numéros supplémentaires appartenant à des plages déjà bloquées ne représentent pas 50 000 protections nouvelles.
Le nombre total d’entrées d’une base communautaire est donc un mauvais indicateur de son efficacité.
Conclusion
Mesurer la protection nouvelle, pas seulement la taille brute
Une base de 77 393 numéros paraît importante lorsqu’on regarde uniquement sa taille. Pourtant, 93,45 % de ses entrées sont déjà comprises dans des plages filtrées. La majorité du reliquat s’explique encore par les données officielles, des numéros internationaux, des codes courts ou des problèmes de format. Seuls 13 numéros français ordinaires restent finalement sans explication.
La question pertinente n’est donc pas « Combien de numéros contient cette base ? », mais « Combien de protections réellement nouvelles apporte-t-elle ? » Sur les données étudiées, la différence entre ces deux notions est considérable.
