Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierinformatique général
  • ✇Korben
  • J'ai créé mon propre outil de stats sans tracking
    Un site sans cookie de mesure d'audience et sans bandeau de consentement, c'est reposant je trouve... Sauf qu'à cause de ça, bah je ne savais plus trop combien de gens venaient me lire tous les jours. Relou hein ? C'était ma situation depuis un moment déjà, vu que tout ce qui servait à mesurer l'audience a dégagé de korben.info il y a un bon bout de temps. Alors faute de mieux, je me suis rabattu sur AWStats, qui lit bêtement les logs Apache du serveur mais bon, c'est pas terrible, parce qu'avec

J'ai créé mon propre outil de stats sans tracking

Par : Korben ✨
21 juillet 2026 à 17:34

Un site sans cookie de mesure d'audience et sans bandeau de consentement, c'est reposant je trouve... Sauf qu'à cause de ça, bah je ne savais plus trop combien de gens venaient me lire tous les jours. Relou hein ?

C'était ma situation depuis un moment déjà, vu que tout ce qui servait à mesurer l'audience a dégagé de korben.info il y a un bon bout de temps. Alors faute de mieux, je me suis rabattu sur AWStats, qui lit bêtement les logs Apache du serveur mais bon, c'est pas terrible, parce qu'avec le cache de Cloudflare, il y a une grosse partie de mon trafic qui n'est pas pris en compte.

En effet, quand Cloudflare possède une copie valide de la page dans son cache, il peut la renvoyer directement sans contacter le serveur d'origine. Vous êtes donc bien un visiteur réel, mais Apache ne voit aucune requête et AWStats ne vous comptabilise pas. Du coup, tous les outils fondés exclusivement sur les logs d'origine sous-estiment la part du trafic absorbée par le cache.

Après il y a bien le classique Google Analytics, mais bon même configuré en mode full RGPD, ça reste Google et ça appelle quand même un service tiers aux US... Vous connaissez aussi déjà des alternatives propres, puisque je vous ai parlé de Matomo, Plausible et de Vince Analytics , mais elles ajoutent toutes une mesure côté navigateur, avec un script, un pixel ou un stockage local (le localstorage) et moi, je ne voulais aucun outil d'audience de plus dans vos pages !

De son côté, Cloudflare lui, voit chaque requête HTTP qui atteint son réseau, y compris celles auxquelles son cache répond. Ses chiffres couvrent donc beaucoup mieux le trafic HTTP que mes logs d'origine. Le souci, c'est que son dashboard, je ne l'aime pas. Je le trouve incomplet, mal foutu, chiant à utiliser, et il ne montre pas ce que j'ai envie de voir.

Donc, histoire d'avoir ce que je voulais, j'ai fini par coder le mien. Enfin, entièrement vibe codé et ça tourne aussi bien sur un serveur qu'en local sur une machine de bureau.

Petite parenthèse pendant que j'y suis, vous ne le savez peut-être pas mais depuis que ChatGPT a débarqué dans nos vies fin 2022, tout ce que je développe moi-même sur ce site et l'ensemble de mes outils internes sont vibes codés avec des LLMs comme ceux d'OpenAI et d'Anthropic. C'était une purge au tout début et maintenant ça s'est tellement amélioré et je me suis tellement spécialisé là-dedans, que le code n'est devenu qu'une formalité. Ne hurlez pas, mon site est statique et j'envoie pas de fusée dans l'espace !

Mon collecteur s'exécute en local, cause à une API, et il n'envoie pas une seule ligne de mesure dans votre navigateur. Bref, que mon backend soit écrit avec un LLM, à la main ou en Brainfuck, vous chargez exactement la même chose de mon outil de stats, c'est-à-dire rien du tout. La garantie est donc architecturale et pas une question de talent.

Et surtout, mon outil de stats n'ajoute aucune mesure dans votre navigateur. Aucun JavaScript ni cookie supplémentaire n'est posé par mon outil. À la place, il lit l'API GraphQL Analytics de Cloudflare, en lecture seule et récupère des compteurs déjà agrégés par jour et par dimension. Cela veut dire par exemple, que quand je récupère le nombre "nombre d'IP distinctes par jour", je ne récupère pas les IPs en tant que telles mais juste un total que Cloudflare me communique et qu'il a déjà traité en amont.

Et vous n'êtes pas obligés de me croire sur parole, parce que c'est vérifiable en 10 secondes... Ouvrez l'inspecteur de votre navigateur, onglet Réseau, et rechargez cette page. Vous ne verrez aucun script de mesure d'audience, aucun appel vers un domaine tiers et aucune iframe. Même les vidéos YouTube ne se chargent qu'au moment où vous cliquez sur la vignette. Le seul truc qui bouge, c'est le compteur du footer qui télécharge un nombre, sans rien renvoyer derrière.

Attention, ce n'est pas à confondre avec Cloudflare Web Analytics et ses mesures RUM (Real User Monitoring) puisque cette fonctionnalité injecte un bout de JavaScript pour mesurer les performances ressenties dans le navigateur. Chez moi, c'est désactivé tout ça.

Maintenant soyons clairs sur un point, parce que c'est l'objection évidente et qu'elle est parfaitement légitime... Cloudflare, lui, voit bien votre adresse IP. Pas à cause de mon outil de stats, mais parce que c'est un reverse proxy et que c'est mécaniquement ce qui se passe dès qu'un site est derrière un CDN. Votre requête arrive chez eux avant d'arriver chez moi, sinon ils ne pourraient ni router, ni mettre en cache, ni bloquer une attaque. Mon outil ne change rien à ça, il se contente de lire des totaux déjà calculés et je ne récupère jamais la moindre IP. Tout est détaillé dans mes CGU, avec les bases légales, les durées et la liste des cookies de sécurité, si vous voulez le détail complet.

Mon outil et le compteur que vous pouvez retrouver dans le footer de mon site reposent sur les requêtes collectées côté serveur chez Cloudflare et sans l'analyse web, je ne peux juste pas suivre par exemple un parcours utilisateur, connaitre un taux de rebond ou évaluer les temps de chargement mesurés chez les lecteurs. Rien de grave donc...

Maintenant, il y a un souci chez Cloudflare, c'est que selon le jeu de données et le forfait que vous payez ou non, le détail ne reste interrogeable que durant une fenêtre limitée de temps. Mon outil doit donc passer chaque jour récupérer les agrégats encore disponibles et les stocker dans une base SQLite sur mon serveur ou en local, selon la façon dont on l'a déployé.

Ça me permet de garder mon propre historique agrégé. J'ai aussi activé le Super Bot Fight Mode de Cloudflare, qui réduit une large partie du trafic automatisé, mais attention, ça ne me donne pas pour autant des stats sans aucun bot. Les crawlers autorisés comme Googlebot et ceux qui passent entre les mailles du filet restent comptabilisés dans mes chiffres, exactement comme avec tous les autres outils de mesure web. Et je préfère le dire clairement plutôt que de vous vendre des chiffres "propres" qui ne le sont jamais totalement, vu qu'un filtre anti-bot ne peut retirer que les bots qu'il a détectés.

À côté de ça, j'ai aussi branché ma Google Search Console, et là non plus sans installer la moindre bibliothèque tierce... Je signe moi-même un JWT en RS256 avec le module crypto natif de Node, je l'échange contre un jeton d'accès chez Google, et le compte de service que j'utilise est restreint au scope lecture seule. Ça m'apporte des statistiques agrégées sur les impressions, les positions, les requêtes de recherche et surtout Discover !!

Si je devais résumer ça, je dirais que Cloudflare estime le volume de trafic et que Search Console montre quelles recherches produisent des impressions et des clics, même si sans aucun tracking en place, ça n'explique évidemment pas la motivation de chaque lecteur. Mais osef ! Et comme Cloudflare embarque aussi son pare-feu, j'en profite pour rapatrier des statistiques sur les événements de sécurité et les routes attaquées, comme ça, je peux tout voir au même endroit.

Maintenant, le vrai plaisir, c'est de pouvoir afficher ce que je veux dans mon propre dashboard. Par exemple, la répartition par langue, les navigateurs, d'où provient le trafic avec un joli petit camembert, les pays, l'état de mon cache, la bande passante, etc. Et quand j'ai un nouveau besoin qui me pête dans le cerveau, je peux ajouter une vue rapidement et je ne m'encombre pas de ce qui ne me sert pas.

Sans traceur placé chez vous, je ne connais donc pas les sessions, le taux de rebond, le parcours de lecture, les entonnoirs de conversion, donc impossible de savoir si vous êtes revenu hier, ni dans quel ordre vous avez lu 3 articles. Mais je m'en tape complètement puisque ces métriques ne m'ont jamais servi à rien.

Ce que je veux connaitre, c'est surtout l'ordre de grandeur de l'audience et le nombre de pages demandées. Le parcours individuel et les entonnoirs de conversion, c'est surtout un besoin de régie publicitaire ou de site e-commerce, et pas d'un site comme le mien. Quand on sait que les bandeaux de cookies nous coûtent 575 millions d'heures perdues collectivement, et que l'Europe réfléchit enfin à les alléger , s'en passer n'est pas vraiment une punition.

Bref, mes stats sont maintenant plus digestes que celles d'AWStats, sans avoir à vous tracker ou vous faire charger quoi que ce soit. Ça me va donc très bien. Et si vous voulez un avant-goût de la technique derrière l'outil, j'ai montré récemment comment vous faire un compteur de fréquentation gratuit , donc n'hésitez pas à y jeter un œil...

  • ✇Korben
  • Empreintes et ADN - Le vrai prix de votre ESTA
    Vos empreintes digitales, votre photo et jusqu'à votre ADN, voilà ce que les États-Unis aimeraient consulter directement dans les fichiers de police européens. Le deal s'appelle Enhanced Border Security Partnership (EBSP), et la monnaie d'échange, vous la connaissez bien si vous avez déjà voyagé aux États-Unis. C'est ce petit formulaire ESTA que vous remplissez avant de filer à New York ou ailleurs (celui qui vous évite le visa). Le projet d'accord, vous n'étiez pas censé le lire, mais l'ONG Sta

Empreintes et ADN - Le vrai prix de votre ESTA

Par : Korben ✨
20 juillet 2026 à 17:16

Vos empreintes digitales, votre photo et jusqu'à votre ADN, voilà ce que les États-Unis aimeraient consulter directement dans les fichiers de police européens. Le deal s'appelle Enhanced Border Security Partnership (EBSP), et la monnaie d'échange, vous la connaissez bien si vous avez déjà voyagé aux États-Unis. C'est ce petit formulaire ESTA que vous remplissez avant de filer à New York ou ailleurs (celui qui vous évite le visa).

Le projet d'accord, vous n'étiez pas censé le lire, mais l'ONG Statewatch l'a publié en avril dernier et son article 3 range dans les données biométriques vos empreintes, vos photos et vos données génétiques (oui, votre ADN). Washington réclame cet accès depuis février 2022 à tous les pays dont les citoyens, comme vous, voyagent sans visa, et le Conseil de l'UE a autorisé la Commission à négocier le 16 décembre 2025.

Bruxelles jure vouloir un système de requête ponctuelle (c'est-à-dire un tuyau d'accès), avec ce que le mandat du Conseil appelle "une limitation claire des finalités des données échangées, avec des déclencheurs très spécifiques". Sauf que la demande américaine d'origine, elle, parle de cribler "de façon routinière" les bases biométriques des pays partenaires.

Entre les deux il y a donc un gouffre !

Et le texte ne s'arrête d'ailleurs pas à la biométrie puisqu'il prévoit de faire circuler des "indications de risque" pour déterminer si votre entrée "poserait un risque réel pour la sécurité publique ou l'ordre public". Traduisez : votre profil, vos fréquentations, vos opinions. Vous vous souvenez de ce touriste refoulé à cause d'un mème sur JD Vance ? Ou toutes ces histoires de douaniers qui fouillent votre téléphone à l'arrivée ? Bah je vous laisse imaginer la cata...

Statewatch pointe surtout la contradiction avec le droit européen lui-même. L'article 9 du RGPD interdit en principe de traiter les données génétiques, et le projet se contente de "garanties appropriées". En effet, la Charte protège les Européens contre la discrimination fondée sur les opinions politiques mais ça, le texte qui cadre ce Enhanced Border Security Partnership, n'en dit rien.

La Cour de justice de l'UE avait retoqué en 2022, dans son arrêt sur le PNR (Passenger Name Record), les traitements automatisés qui décident sans humain dans la boucle, et voilà que ça revient sur le devant de la scène d'une autre manière.

Franchement, c'est relou. On nous impose des bandeaux cookies sur chaque site de recettes de cuisine, on fait tenir un registre de traitement au moindre club de pétanque et pendant ce temps-là, le Conseil européen négocie tranquillou un accès que j'estime abusif pour une administration étrangère à des fichiers d'empreintes (biométriques) nationaux. Ça fait un peu mal au cul vous ne trouvez pas ???

Alors, certes, on voyage sans visa, même si, quelque part, l'ESTA c'est un peu un visa qui ne dit pas son nom. Enfin, moi, je vois pas trop la différence sur le fond... Et puis dans cette Europe à deux vitesses, on a quand même la Bulgarie, Chypre et la Roumanie qui, eux, ont besoin d'un visa. Donc on n'est pas très solidaire sur le coup.

Puis je vous rappelle que les fichiers d'identité français ne sont pas franchement des coffres-forts quand on pense par exemple à l'ANTS qui s'est fait siphonner 19 millions de dossiers via une faille basique . Et sur le sérieux de nos amis américains, je repense à cette grand-mère américaine qui a passé six mois en prison à cause d'un faux positif de reconnaissance faciale, et je me dis que si on y ajoute un croisement transatlantique automatisé des données, ça va pas être joli joli en termes de bourdes...

Bref, pour le moment rien n'est signé et les États membres se déchirent encore sur la portée et les durées de conservation de NOS données qu'ils vont offrir aux États-Unis. Et on verra bien si le Parlement va donner son feu vert, mais en tout cas c'est maintenant que tout se joue.

Voilà, surveillez ce dossier de près et je vous invite à aller lire l'analyse de Statewatch parce qu'elle est plutôt salée.

  • ✇Korben
  • Un compteur de visiteurs sur votre site, sans payer un centime
    Vous avez peut-être remarqué un petit point rouge tout en bas de mon site, avec un nombre à côté. Il s'agit du nombre de personnes passées sur le site durant la dernière heure. Je voulais remettre ce truc depuis un bail, bien à l'ancienne comme dans les années 2000 mais sur un site statique, qui plus est sans tracker de stats JS type Google Analytics ou Matomo, et sans cookies de tracking, c'était pas franchement une option... jusqu'à maintenant !

Un compteur de visiteurs sur votre site, sans payer un centime

Par : Korben ✨
12 juillet 2026 à 07:45

Vous avez peut-être remarqué un petit point rouge tout en bas de mon site, avec un nombre à côté. Il s'agit du nombre de personnes passées sur le site durant la dernière heure.

Je voulais remettre ce truc depuis un bail, bien à l'ancienne comme dans les années 2000 mais sur un site statique, qui plus est sans tracker de stats JS type Google Analytics ou Matomo, et sans cookies de tracking, c'était pas franchement une option... jusqu'à maintenant !

Le compteur, en vrai, tout en bas de korben.info.

La solution évidente sur des sites statiques, c'est souvent un petit Worker Cloudflare qui compte les visiteurs et servirait le chiffre, mais ça se facture à chaque requête. À 390 000 pages vues par jour, ça grimpe vite à des dizaines de millions d'invocations par mois, soit dans les 6 à 7 dollars. C'est pas super cher mais pour un compteur qui n'est utile qu'à satisfaire mon égo tout en sachant s'il y a du monde aujourd'hui, ça ne sert strictement à rien ! Donc le Worker, je l'ai écarté direct.

Du coup j'ai fait ça à l'ancienne. Un petit script Python tourne sur la machine qui héberge le site, une fois par minute. Il pose une seule question à Cloudflare, à savoir combien d'adresses IP distinctes ont chargé une page durant la dernière heure (ou demi-heure, ou quart d'heure ou 5 min, c'est vous qui paramétrez), il écrit la réponse dans un minuscule fichier live.json de quelques centaines d'octets, et c'est tout. Ce fichier, Cloudflare le sert ensuite depuis son cache comme il servirait une image, gratuitement. Zéro Worker, zéro base de données, zéro abonnement, j'ai exactement le même résultat sans dépenser une thune.

Maintenant, faut que je sois clair sur ce que ce chiffre raconte. C'est le nombre de navigateurs distincts ayant chargé une page durant la dernière heure, hors trafic interne de Cloudflare. C'est un "*combien de monde est passé récemment *", pas un "combien lisent là tout de suite".

Et les bots là-dedans ?

En fait, les bots pourris , ceux qui scrapent en boucle, se font bloquer en amont par le Super Bot Fight Mode de Cloudflare, donc ils n'arrivent même pas jusqu'à mon site. Restent les gentils bots, du genre de Googlebot et compagnie, que je laisse passer exprès, parce que les bloquer reviendrait à me flinguer mon référencement. Sur les 7 derniers jours, Cloudflare classe à peine 4% comme bots vérifiés. Donc c'est une goutte d'eau, surtout qu'ils tournent sur une poignée d'IP. Donc oui, mon compteur avale deux ou trois crawlers au passage, mais je ne voulais pas vous mentir en écrivant "zéro bot". Mais l'essentiel c'est que les nuisibles, eux, ne soient pas comptabilisés.

J'ai aussi dû gérer un petit piège car l'API de Cloudflare plafonne sa réponse à 10 000 lignes. Et comme sur une heure entière de trafic ça peut se remplir vite, si je crève ce plafond, la requête sous-compterait sans rien dire. Donc le script lève un flag et le compteur affiche "10 000 personnes ou plus" plutôt qu'un faux nombre. Quand j'y serai aux 10 000 et plus, je pense que je réduirai alors le delta temps en passant de 1h à 30 min...etc.

Côté vie privée, c'est carré également. Cloudflare renvoie à mon serveur une liste JSON des IP passées dans l'heure, mon script en compte le nombre de distinctes, et efface cette liste de sa mémoire dans la milliseconde qui suit. Aucune IP n'est stockée, aucune n'atterrit dans un log, aucun fichier avec les IPs n'est créé sur le disque... Il ne reste qu'un entier. Comme je vous le disais, pas de cookie , pas de traceur, et rien qui touche votre navigateur . Et comme le compteur ne s'affiche jamais en dessous de 10 personnes, impossible d'isoler qui que ce soit.

Maintenant, si vous voulez le même chez vous, sachez que j'ai tout balancé en open source sur GitHub , sous licence MIT, donc servez-vous. Voici les pré-requis :

  1. votre site doit être derrière Cloudflare, le plan gratuit suffit largement.
  2. vous générez un token API Cloudflare avec le droit de lecture sur les analytics.
  3. vous posez le script live_count.py sur votre serveur et vous le lancez une fois par minute (ou toutes les 5 ou 10 min) via un cron.
  4. vous ajoutez le bout de JavaScript et son span dans vos pages, tout se règle par des attributs, aucun script inline, donc ça passe même avec une politique de sécurité stricte.

Le seul truc sur lequel ne pas vous louper, c'est de mettre un temps de cache court à live.json. Si c'est trop long, tous vos visiteurs verraient un chiffre périmé.

Voilà. Un petit compteur maison simili-live sans tracking et qui ne me coûte rien, c'est le bonheur !

  • ✇Korben
  • Données de santé Doctolib - Comment vous opposer à leur usage IA ?
    Cet aprem, je bossais tranquillou quand j'ai reçu un mail de DoctoLib qui m'a bien énervé avec pour titre : "Doctolib s'engage dans la recherche pour améliorer la santé". Bon, si on s'arrête au titre, on se dit "Ah bravo, Doctolib", sauf qu'en le lisant en entier, j'ai vite compris qu'ils venaient de décider à ma place que mes données de santé allaient nourrir des trucs, des bidules et des machins pour de la recherche en intelligence artificielle. Et bien sûr que si ça ne me plaisait pas, bah

Données de santé Doctolib - Comment vous opposer à leur usage IA ?

Par : Korben ✨
8 juillet 2026 à 17:23

Cet aprem, je bossais tranquillou quand j'ai reçu un mail de DoctoLib qui m'a bien énervé avec pour titre : "Doctolib s'engage dans la recherche pour améliorer la santé". Bon, si on s'arrête au titre, on se dit "Ah bravo, Doctolib", sauf qu'en le lisant en entier, j'ai vite compris qu'ils venaient de décider à ma place que mes données de santé allaient nourrir des trucs, des bidules et des machins pour de la recherche en intelligence artificielle.

Et bien sûr que si ça ne me plaisait pas, bah fallait que je le dise.

Alors ce qu'ils expliquent dans ce mail, c'est qu'à partir d'août 2026, Doctolib lance un projet de recherche mené par une équipe associée à Inria, l'Inserm et l'Université Paris Cité pour, je cite "améliorer les parcours de soins grâce à l'IA". Jusque-là, difficile de cracher dessus, ce sont des institutions publiques sérieuses et l'objectif est louable. Le truc, c'est ce qu'ils vont manger pour y arriver : nos données démographiques, nos données de santé, et même celles de vos proches rattachés à votre compte. Et cela que ces données aient été renseignées par nous ou par nos soignants.

Et surtout, Doctolib ne nous demande pas notre accord. Ils s'appuient sur ce qu'on appelle l'intérêt légitime, une base légale du RGPD qui leur permet de piocher dans nos données sans passer par la case consentement. Hé ouais, en clair, on ne vous prend pas votre consentement, on vous l'enlève. Vous n'avez même pas à dire oui, c'est déjà oui par défaut, et vous êtes obligé de dire non si vous voulez sortir du dispositif.

Ils présentent ça comme de l'intérêt légitime, sauf qu'en même temps on ne sait pas du tout sur quoi ils vont bosser, on ne sait pas avec qui ils vont bosser, on ne sait pas comment nos données seront sécurisées, bref, on ne sait rien du tout. Alors forcément, moi je m'inquiète surtout que leur mail annonce clairement que d'autres travaux suivront, "avec des hôpitaux ou des institutions privées ou publiques". Donc on accepte qu'ils signent à notre place un chèque en blanc avec nos données pour des projets futurs dont personne ne connaît le contenu et basta, tout ça sous couvert d'intérêt légitime. Ce n'est que mon avis mais je trouve ça vraiment léger.

Alors oui, tout ça est parfaitement légal. Doctolib s'appuie sur la méthodologie MR-004 de la CNIL , qui encadre la recherche en santé et autorise justement ce fonctionnement par opposition plutôt que par consentement. Rien d'illégal là-dedans. Mais légal ne veut pas dire que je dois être d'accord.

Et c'est bien ça le problème... Ce cadre légal permet à une entreprise privée comme Doctolib de considérer que nos données de santé lui appartiennent assez pour les offrir (ou les revendre, je n'en sais rien ??) à la recherche, tant que vous ne levez pas la main pour refuser.

Doctolib tente de nous rassurer aussi en expliquant que les données sont pseudonymisées et "ne permettent pas de nous identifier directement". Notez bien le "directement", lol, ça ne se mouille pas trop. En réalité, pseudonymisé, ça ne veut pas dire anonyme... Ça veut seulement dire qu'on a remplacé votre nom par un code, mais que le lien existe toujours quelque part et reste réversible. Aux yeux de la loi, ça reste encore vos données personnelles . La vraie anonymisation, elle, est irréversible, et ce n'est pas ce dont on parle ici.

Et puis il y a le contexte... Non, Doctolib n'a pas subi de grosse fuite de données, il faut être honnête là-dessus mais on nage actuellement dans un écosystème tech en France qui prend l'eau de partout : 33 millions de Français touchés par le piratage des mutuelles Viamedis et Almerys début 2024, une quinzaine de millions de plus avec la fuite Cegedim en 2026. Chaque base de données de santé qui se constitue quelque part, c'est une cible de plus.

Et il y a un mois à peine, le Canard Enchaîné accusait Doctolib de transmettre des infos à Google, Microsoft et Anthropic pour de l'IA. Doctolib a répondu que ces boîtes n'étaient que des prestataires techniques qui n'entraînent pas leurs modèles avec vos données. Alors peut-être, hein, mais quand on nous demande de faire confiance sur parole pour des données aussi intimes que notre santé, l'inquiétude a le droit d'exister.

Bref, moi je m'oppose, et si vous êtes sur Doctolib je vous invite au moins à décider en connaissance de cause. Le mail est probablement arrivé dans vos spams, donc pour refuser, sachez que ça se passe dans les paramètres de confidentialité de votre compte, via le formulaire d'exclusion de la recherche . Ça bloque toute utilisation future de vos données et de celles de vos proches, sans aucun impact sur vos rendez-vous ni sur vos soins. Faites-le avant août 2026, car c'est le moment où le premier projet démarre.

Enfin bref, moi je pense qu'on devrait avoir à donner son accord, et pas à courir derrière ces boîtes pour retirer un accord qu'on n'a jamais donné en pleine conscience... C'est ça qui me dérange surtout.

  • ✇LinuxFr.org : les dépêches
  • De la fermeture des comptes inactifs depuis 3 ans
    En février 2023, nous avions décrit « les données à caractère personnel traitées, qu’elles soient ou non associées à un compte, le cycle de vie de ses données et le changement de politique concernant ce cycle de vie. » La règle a été mise en place au 28 juin 2023 (la date de dernière activité du compte ayant été mise en place au 31 mai 2023) : les comptes inactifs pendant trois ans sont fermés et les données conservées inutiles au service supprimées ; les comptes fermés depuis plus d’un an vo

De la fermeture des comptes inactifs depuis 3 ans

En février 2023, nous avions décrit « les données à caractère personnel traitées, qu’elles soient ou non associées à un compte, le cycle de vie de ses données et le changement de politique concernant ce cycle de vie. » La règle a été mise en place au 28 juin 2023 (la date de dernière activité du compte ayant été mise en place au 31 mai 2023) :

  • les comptes inactifs pendant trois ans sont fermés et les données conservées inutiles au service supprimées ;
  • les comptes fermés depuis plus d’un an voient les données associées inutiles au service supprimées (cf dépêche d'évaluation 1 an après en 2024)

Depuis trois ans, les comptes fermés (par la personne détenant le compte ou par l’équipe de modération sur les spams par exemple) voient donc leurs données minimisées. La nouveauté cette année était la fermeture des comptes inactifs depuis trois ans.

    Quelques chiffres pour donner une idée de l’évolution des comptes

    • un an, c’est 961 comptes ouverts (et 286 fermés depuis), entre le 01 octobre 2024 et le 30 septembre 2025 (basées sur les rétrospectives des quinzaines)
    • un an, c’est aussi 1607 tentatives de création de comptes, sur la même période (basé sur les identifiants en base de données), dont beaucoup ne sont visiblement jamais confirmés et donc jamais réellement ouverts (spam, erreur d’adresse, erreur sur le pseudo voulu, etc.)

    Application de la règle des 3 ans d’inactivité

    Regardons les statistiques conservées par archive.org du 11 avril dernier, soit avant l’échéance des trois ans d’inactivité du 31 mai dernier :

    • 53599 utilisatrices et utilisateurs ayant ou ayant eu des comptes (et encore présents en base de données)
    • 33150 comptes
    • 1384 comptes fermés

    Et comparons avec les statistiques au moment de l’écriture de la dépêche, en base de données on trouve :

    • 38847 utilisatrices et utilisateurs ayant ou ayant eu des comptes (et encore présents en base de données)
    • 18397 comptes
    • 12380 comptes fermés

    Il y a donc eu purge de plus de 14500 comptes et fermeture de plus de 10000 comptes au 31 mai 2026.

    Pourquoi certains comptes sont purgés ? Car ils n’avaient aucun contenu public ou commentaire public ou contribution à des contenus publics. Il peut s’agir de personnes n’ayant jamais rien eu à dire sur le site, de spammeurs n’ayant jamais réussi à publier quoi que soit, etc. La volumétrie est aussi due au stock puisque le traitement s’est appliqué à tous les comptes concernés depuis 1999 (année du plus vieux compte en base de données).

    Pourquoi certains comptes sont fermés ? Parce qu’ils restent associés un ou plusieurs contenus ou commentaires ou contributions publics. Les cas peuvent être multiples : la personne est décédée, la personne est passée à autre chose, la personne avait juste besoin de poser une question à un moment et n’est donc pas restée, la personne est depuis 3 ans en prison ou en orbite ou dans un sous-marin ou tout autre endroit hors-ligne, etc.

    Conséquences techniques ?

    Va-t-on réutiliser les identifiants libérés dans la base de données de comptes ? Il n’y a pas vraiment d’intérêt à le faire.

    A-t-on gagné sur le volume des sauvegardes ? La table des versions de dépêches pèse ~9 GiB pour ~430000 tuples, celle des commentaires ~3 GiB pour 2M de commentaires. La table des comptes n’est que la 11e plus volumineuse en base, avec 18 MiB. Donc non on ne gagne rien de significatif. Probablement moins que si on supprimait dès maintenant les encore présents en base 700 contenus non publics et 21900 commentaires non publics.

    Est-ce que tout le site va aller plus vite ? Non, ça ne va pas être perceptible sur les requêtes SQL.

    Quel serait le cas le plus favorable en termes de réduction des données ? L’anonymisation du compte et de tout ce qui est associé : cela supprime un compte bien sûr, mais ça permettait en théorie de fusionner des éditions de dépêches par exemple : si Anonyme, seul compte contributeur, a 82 éditions d’une même dépêche, alors des années après, on peut sans doute se contenter de ne garder que la première et la dernière édition par exemple (pour préserver dates et attribution). Et même si Anonyme a seulement les éditions 53 à 57 d’une dépêche, on pourrait faire de même sur cette partie contiguë.

    Aide sur le sujet

    P.S. : cette dépêche sera ma 500e dépêche publiée

    Commentaires : voir le flux Atom ouvrir dans le navigateur

    • ✇Korben
    • OpenAI Privacy Filter - Masquez vos données perso en local
      OpenAI vient de sortir un modèle open source qui repère et masque les données perso dans un texte, et le plus marrant, c'est qu'il tourne chez vous, pas chez eux. Ça nous change ^^. Ça s'appelle Privacy Filter , c'est sous licence Apache 2.0, et ce modèle chope les infos sensibles : noms, emails, téléphones, adresses, numéros de compte, dates perso, et même les secrets genre clés d'API ou tokens. Il se compose de 1,5 milliard de paramètres au total, ce qui est tout petit, du coup ça tient sur un

    OpenAI Privacy Filter - Masquez vos données perso en local

    Par : Korben ✨
    30 mai 2026 à 07:46

    OpenAI vient de sortir un modèle open source qui repère et masque les données perso dans un texte, et le plus marrant, c'est qu'il tourne chez vous, pas chez eux. Ça nous change ^^.

    Ça s'appelle Privacy Filter , c'est sous licence Apache 2.0, et ce modèle chope les infos sensibles : noms, emails, téléphones, adresses, numéros de compte, dates perso, et même les secrets genre clés d'API ou tokens.

    Il se compose de 1,5 milliard de paramètres au total, ce qui est tout petit, du coup ça tient sur un laptop et peut même tourner dans un navigateur via transformers.js. Et à chaque token, seulement 50 millions de paramètres bossent vraiment, puisque le modèle pioche dans ses "experts" au lieu de tout activer... donc c'est ultra rapide. Et vos données, elles, ne partent jamais en ligne, donc pour de la donnée sensible, c'est tip top !

    Côté usage, c'est 3 lignes :

    import { pipeline } from "@huggingface/transformers";
    const filter = await pipeline("token-classification", "openai/privacy-filter");
    await filter("My name is Korben and my email is korben@example.com");
    

    Au premier appel, transformers.js télécharge le modèle, et après localement, le modèle vous ressort chaque bout de texte étiqueté comme perso (ça c'est un nom, ça un email...etc) et comme ça, vous n'avez plus qu'à les remplacer par des balises avant de balancer le tout dans un LLM ou dans des logs par exemple.

    La classification "secret" attrape les clés d'API et les tokens qui traînent, bref, tout ce qu' un dev peut oublier dans son code (oui, ça arrive ^^ hein). C'est la classification qui me semble la plus utile au quotidien.

    Alors comment ça fonctionne ? Eh bien le modèle lit toute la phrase d'un coup au lieu de cracher du texte mot par mot comme un ChatGPT, puis recolle les morceaux avec un décodeur Viterbi pour éviter de couper un nom en deux. Il avale jusqu'à 128 000 tokens de contexte, et vous pouvez régler le curseur précision/rappel via des presets fournis : soit il masque large, quitte à raturer un mot innocent, soit il la joue finement. Pratique donc selon que vous bossiez sur du dossier médical ou un ticket de support random.

    Notez que c'est pas le premier sur le créneau. Par exemple Microsoft Presidio fait du masquage PII depuis des années, gère plus de langues, et sait même bosser sur les images et les données structurées. Là où Privacy Filter marque des points, je trouve, c'est le contexte car il distingue mieux un nom de famille du même mot employé autrement, alors qu'une simple regex se vautre à 100%.

    Après c'est surtout calibré pour l'anglais, donc sur du français ou des formats régionaux ça peut louper des trucs. Donc vérifiez bien le résultat avant de vous reposer entièrement dessus. Mais ça reste un bon filet de sécurité même si c'est pas une garantie d'anonymat béton.

    Sachez aussi que pour changer la liste des catégories détectées c'est possible, mais faudra repasser par du fine-tuning.

    Bref, voir que de temps en temps OpenAI continue de publier des outils open source qui tournent en local, c'est toujours une bonne surprise !

    Bref, si vous manipulez de la donnée perso, allez jeter un œil, c'est par ici .

    • ✇Korben
    • Utiq - Le pistage pub de votre opérateur et comment l'éviter
      Si vous avez cliqué un peu vite sur "J'accepte" ces derniers jours, vous avez peut-être activé Utiq sans le savoir. Si ça ne vous dit rien, c'est normal puisque c'est le nouvel identifiant publicitaire monté comme des grands par les opérateurs télécoms européens, dont Orange, Deutsche Telekom, Vodafone et Telefónica, et qui vous piste via votre connexion à Internet. Plutôt qu'un cookie planqué dans votre navigateur, Utiq s'appuie tout simplement sur votre box ou votre forfait mobile avec un iden

    Utiq - Le pistage pub de votre opérateur et comment l'éviter

    Par : Korben ✨
    29 mai 2026 à 14:29

    Si vous avez cliqué un peu vite sur "J'accepte" ces derniers jours, vous avez peut-être activé Utiq sans le savoir. Si ça ne vous dit rien, c'est normal puisque c'est le nouvel identifiant publicitaire monté comme des grands par les opérateurs télécoms européens, dont Orange, Deutsche Telekom, Vodafone et Telefónica, et qui vous piste via votre connexion à Internet.

    Plutôt qu'un cookie planqué dans votre navigateur, Utiq s'appuie tout simplement sur votre box ou votre forfait mobile avec un identifiant attribué à votre ligne fixe (fibre ou ADSL) ou mobile.

    Par exemple, comme on peut le lire sur AuFeminin :

    Et c'est là que ça pique fort car comme l'identifiant vient de la connexion et pas du navigateur, il se moque éperdument des protections habituelles. Vous videz le cache ? Il s'en balek ! Navigation privée ? Pareil. Vous changez de navigateur ou d'appareil ? Tant que c'est la même connexion, vous restez la même personne aux yeux des annonceurs.

    Et le pire, c'est que cet identifiant ne vous colle pas qu'à vous mais à toute votre box. Utiq le dit noir sur blanc : "toutes les personnes utilisant la même connexion et ayant consenti se verront attribuer le même identifiant". En clair, si votre ado, votre coloc ou votre moitié clique sur "J'accepte" sur un site, leur navigation vient se mélanger à la vôtre sous une seule et même étiquette. Et quand vous filez gérer vos réglages sur le consenthub, vous récupérez aussi les consentements donnés par les autres membres du foyer. Bref, le truc vendu comme plus propre que le cookie finit par pister le foyer entier, alors qu'un bon vieux cookie, lui, restait sagement dans VOTRE navigateur…

    Pour finir le travail, Utiq demande même aux sites un petit sous-domaine maison, du genre utiq.lamarque.fr, qui pointe vers ses propres serveurs. Cette technique de CNAME cloaking fait ainsi passer le mouchard pour le site lui-même, et hop, il passe alors sous le radar d'une bonne partie des bloqueurs de traceurs, votre uBlock compris !

    Bon, après ce n'est pas non plus Big Brother (et non, votre smartphone ne vous écoute pas ) puisque l'activation passe obligatoirement par votre consentement, et un opérateur qui ferait n'importe quoi avec vos données de connexion risquerait très gros au regard de la directive ePrivacy.

    Le vrai souci, que Next a bien pointé d'ailleurs, c'est que l'identifiant de base que livre l'opérateur, le fameux "Network Signal", est une boîte noire totale. À en croire Next, même la CNIL n'en connaît pas le contenu exact. Difficile donc de parler de "consentement éclairé" quand personne ne sait vraiment ce qu'on accepte...

    Ce bidule intrusif a déjà une ampleur folle, avec 36 opérateurs partenaires, plus de 330 éditeurs et 75 millions d'identifiants créés, dont 40 millions rien qu'en France ! Renault a même été l'un des premiers annonceurs à dégainer cette techno.

    Et le plus fou, c'est que c'est vendu comme l'alternative "éthique et européenne" aux GAFAM. En gros, vous troquez Google contre votre opérateur, ce qui en fonction de l'opérateur n'est pas très rassurant ^^.

    Heureusement, sortir du game prend à peine 30 secondes. Foncez sur consenthub.utiq.com , et vous pourrez bloquer Utiq pour un an d'un coup. C'est aussi là que vous verrez si vous êtes déjà enrôlé. Après sur les sites web qui l'ont implémenté, cliquez sur Rejeter, ou refusez Utiq dans les détails des réglages du site.

    Et si vous voulez la ceinture et les bretelles, un VPN changera l'adresse IP sur laquelle repose le système et brouillera sérieusement les pistes. D'ailleurs, je le rappelle, ici, vous ne croiserez ni Utiq, ni cookie publicitaire, ni tracker mais juste de gros liens vers mon Patreon pour le soutien ^^.

    Voilà, donc rien d'apocalyptique sous le soleil mais quand même 2 ou 3 trucs à savoir pour ne pas se faire berner...

    Source

    • ✇Korben
    • Amazon Wishlist - Votre adresse livrée avec le cadeau
      Amazon, fournisseur officiel de mauvaises idées en matière de vie privée depuis 1870 vient de nous pondre une nouvelle trouvaille !! À partir du 25 mars, si quelqu'un vous achète un cadeau via votre liste de souhaits Amazon, le vendeur tiers récupère votre adresse de livraison. Oui, votre VRAIE adresse !! Après en tant que français on a l'habitude que tous les escrocs de la planète aient nos infos persos . Mais rassurez-vous, Amazon a trouvé une solution ! Est-ce qu'il s'agit de corriger le prob

    Amazon Wishlist - Votre adresse livrée avec le cadeau

    Par : Korben
    26 février 2026 à 15:36

    Amazon, fournisseur officiel de mauvaises idées en matière de vie privée depuis 1870 vient de nous pondre une nouvelle trouvaille !! À partir du 25 mars, si quelqu'un vous achète un cadeau via votre liste de souhaits Amazon, le vendeur tiers récupère votre adresse de livraison. Oui, votre VRAIE adresse !! Après en tant que français on a l'habitude que tous les escrocs de la planète aient nos infos persos . Mais rassurez-vous, Amazon a trouvé une solution ! Est-ce qu'il s'agit de corriger le problème ? Que nenni !! Ils nous recommandent simplement d'utiliser une boîte postale. Sympa !

    Parce que jusqu'ici, quand un pote vous envoyait un truc depuis votre wishlist, le vendeur tiers voyait votre ville et votre région... c'est déjà pas top, mais bon. Sauf que maintenant, c'est l'adresse COMPLÈTE qui part chez le vendeur. Numéro, rue, code postal, la totale...

    Et vous vous en doutez, ça touche en premier lieu les créateurs de contenu, les streamers, et tous les crevards qui ont une wishlist publique pour que leur communauté puisse leur offrir des trucs net d'impôts ^^.

    Donc suffit qu'un harceleur crée un faux compte vendeur sur Amazon Marketplace (La vérification d'identité ? Minimale !), met un article à 3 euros, attend qu'un fan l'achète via la wishlist de sa cible... et hop, il a l'adresse complète récupérée. Pas besoin d'être un génie. Ou alors suffit d'attendre que le vendeur tiers laisse fuiter le fichier Excel dans lequel il stocke ses commandes... La vie est toujours pleine de surprises quand il s'agit de leaker des données perso.

    EDIT : Merci à Matthieu qui m'a envoyé la preuve ! Amazon.fr vient d'envoyer un email à ses utilisateurs pour confirmer que ce changement arrive bien en France à compter du 25 mars 2026. L'option permettant de restreindre les achats auprès de vendeurs tiers pour les articles de vos listes sera supprimée. Donc c'est plus une hypothèse, c'est confirmé... faites le ménage dans vos wishlists MAINTENANT.

    Et côté RGPD ?

    En Europe, le RGPD impose que le partage de données personnelles repose sur une base légale. Consentement explicite, intérêt légitime, ou exécution d'un contrat et pas une case pré-cochée planquée dans les CGU.

    Le problème, c'est qu'Amazon change les règles du jeu en cours de route, sans demander un consentement spécifique pour ce nouveau partage d'adresse avec des tiers. Et bien sûr, le moment venu, la CNIL pourrait avoir deux mots à dire là-dessus... après, on sait comment ça se passe, les amendes mettent des années à tomber. D'ailleurs, Amazon s'est déjà pris 746 millions d'euros par le Luxembourg en 2021 pour non-respect du RGPD mais visiblement, ça ne les a pas trop calmés.

    Pour ceux qui s'intéressent à la suppression de leurs données perso en ligne , c'est le genre de truc qui fait grincer des dents.

    Comment protéger votre adresse ?

    Maintenant concrètement, voici ce que vous pouvez faire (ça ne marche pas à 100% mais c'est mieux que rien) :

    Allez dans votre compte Amazon, section "Listes" puis "Gérer la liste". Vérifiez que votre wishlist est bien en mode "Privée" si vous ne voulez pas que n'importe qui la voie. Attention, le réglage par défaut c'est "Publique"... donc si vous n'avez jamais touché à ça, c'est probablement ouvert aux quatre vents.

    Et si vous VOULEZ la garder publique (streamers, créateurs), utilisez une adresse qui n'est pas votre domicile. En France, une boîte postale La Poste coûte ~50 euros par an. Y'a aussi les Amazon Locker ou les points Mondial Relay... ce qui revient quand même à dire "débrouillez-vous", j'en ai bien conscience.

    Le vrai problème

    Le fond du problème, vous l'aurez compris, n'est pas technique. C'est qu'Amazon traite l'adresse de livraison comme une donnée de transaction banale alors que c'est une info sensible. Mais non, une adresse postale c'est pas un numéro de commande. Et surtout ça casse tout le principe d'anonymat des wishlists surtout quand la plateforme encourage les wishlists publiques depuis des années.

    Bref, c'est confirmé pour la France au 25 mars, alors prenez les devants et prévenez votre influenceur préféré de faire le switch.

    Source

    • ✇LinuxFr.org : les dépêches
    • Ackify CE : preuve de lecture cryptographique en Go + Vue3
      Ackify CE est une plateforme open-source (AGPL v3) permettant de générer des preuves de lecture cryptographiquement vérifiables pour des documents internes. Le problème Les organisations doivent souvent prouver qu'un collaborateur a lu un document (politique RGPD, charte de sécurité, formation obligatoire). Les solutions existantes sont soit trop lourdes (signature électronique qualifiée comme DocuSign à 10-30€/utilisateur/mois), soit non sécurisées (simple email). La solution Ackify génère de

    Ackify CE : preuve de lecture cryptographique en Go + Vue3

    Ackify CE est une plateforme open-source (AGPL v3) permettant de générer des preuves de lecture cryptographiquement vérifiables pour des documents internes.

    Le problème

    Les organisations doivent souvent prouver qu'un collaborateur a lu un document (politique RGPD, charte de sécurité, formation obligatoire). Les solutions existantes sont soit trop lourdes (signature électronique qualifiée comme DocuSign à 10-30€/utilisateur/mois), soit non sécurisées (simple email).

    La solution

    Ackify génère des preuves de lecture cryptographiques avec :

    • Signatures Ed25519 (même algo que SSH)
    • Horodatage immutable (PostgreSQL triggers)
    • Hash chain blockchain-like
    • Vérification offline possible

    Cas d'usage

    • Validation de politiques internes (sécurité, RGPD)
    • Attestations de formation obligatoire
    • Prise de connaissance de procédures
    • Accusés de réception contractuels

    Différence avec DocuSign

    Ackify n'est pas une alternative à DocuSign pour des contrats juridiques. C'est une solution simple pour des besoins internes où la signature qualifiée est overkill.

    N'hésitez pas si vous avez des questions techniques !

    Installation

    curl -fsSL https://raw.githubusercontent.com/btouchard/ackify-ce/main/install/install.sh | bash
    cd ackify-ce
    nano .env  # Configurer OAuth2
    docker compose up -d

    Installation complète en ~5 minutes.

    Stack technique

    Backend

    • Go 1.24 (Clean Architecture / DDD)
    • PostgreSQL 16
    • Chi Router
    • OAuth2 (Google, GitHub, GitLab, custom) ou Magic Link (passwordless)

    Frontend

    • Vue 3 + TypeScript
    • Tailwind CSS
    • i18n (FR, EN, ES, DE, IT)

    DevOps

    • Docker distroless < 30 MB
    • CI/CD GitHub Actions
    • Tests : 72,6% couverture (180 tests unitaires + 33 intégration)

    Commentaires : voir le flux Atom ouvrir dans le navigateur

    • ✇Korben
    • Ackify - Pour confirmer la lecture d'un document
      Benjamin, lecteur de korben.info, m’a envoyé un email pour me parler d’ Ackify , son nouveau projet open-source. L’idée avec Ackify c’est de pouvoir confirmer qu’un document a bien été lu ! Je parle pas de signature électronique, hein. Pour ça y’a déjà DocuSign, Adobe Sign, HelloSign…etc. Non, je vous parle des cas où vous avez juste besoin de prouver que Thérèse de la compta a bien reçu, ouvert et lu le PDF de la nouvelle procédure RGPD. Et pour ça, les solutions du marché sont soit surdimensio

    Ackify - Pour confirmer la lecture d'un document

    Par : Korben
    21 novembre 2025 à 08:34

    Benjamin, lecteur de korben.info, m’a envoyé un email pour me parler d’ Ackify , son nouveau projet open-source. L’idée avec Ackify c’est de pouvoir confirmer qu’un document a bien été lu !

    Je parle pas de signature électronique, hein. Pour ça y’a déjà DocuSign, Adobe Sign, HelloSign…etc. Non, je vous parle des cas où vous avez juste besoin de prouver que Thérèse de la compta a bien reçu, ouvert et lu le PDF de la nouvelle procédure RGPD. Et pour ça, les solutions du marché sont soit surdimensionnées, soit inexistantes, du coup, les boîtes bidouillent avec des Google Forms pourris ou des macros Excel qui traînent dans le coin depuis 2003.

    Ackify tourne en Docker distroless, s’installe en 5 minutes avec un script, et fonctionne sur PostgreSQL 16. L’authentification se fait via Magic Link sans mot de passe, ou OAuth 2 si vous préférez Google, GitHub ou GitLab. Ensuite, une fois connecté, vous lisez le document, vous cliquez sur “J’ai lu”, et c’est terminé. Une signature cryptographique Ed25519 est générée, le checksum SHA-256 du document est vérifié, et tout part dans un audit trail immuable.

    Le principe est donc super solide et chaque utilisateur ne peut signer qu’une seule fois par document. Ensuite, vous en tant qu’admin, vous avez un dashboard pour tracker qui a lu quoi. Il y a également des rappels automatiques par email pour ceux qui traînent et des widgets que vous pouvez intégrer dans votre intranet si ça vous amuse !

    Sans oublier que c’est multi-lingue !

    Bref, que ce soit pour obtenir des attestations de lecture de politiques de sécurité, des formations internes avec validation, la prise en compte de directive RGPD, des procédures de conformité…etc, Ackify pourra vous aider sans avoir à sortir l’artillerie lourde de la signature électronique traditionnelle.

    Voilà, c’est gratuit, open source et vous pouvez avoir tous les détails sur le site officiel du projet : ackify.eu .

    • ✇Korben
    • Stockage + chiffrement + gestionnaire de mots de passe à vie ! Merci pCloud !
      – Article en partenariat avec pCloud – Salut les amis ! Alors que le Black Friday approche à grands pas, pCloud débarque avec une promo qui va faire mal au portefeuille des GAFAM mais bien soulager le votre ! En effet, le service de stockage cloud suisse (oui, celui qui respecte vraiment votre vie privée) sort l’artillerie lourde aujourd’hui avec jusqu’à -60% sur leurs plans à vie, mais surtout avec un pack 3en1 exclusif qui regroupe tout ce dont vous avez besoin pour sécuriser votre vie numériq

    Stockage + chiffrement + gestionnaire de mots de passe à vie ! Merci pCloud !

    Par : Korben
    17 novembre 2025 à 18:23
    – Article en partenariat avec pCloud –

    Salut les amis !

    Alors que le Black Friday approche à grands pas, pCloud débarque avec une promo qui va faire mal au portefeuille des GAFAM mais bien soulager le votre ! En effet, le service de stockage cloud suisse (oui, celui qui respecte vraiment votre vie privée) sort l’artillerie lourde aujourd’hui avec jusqu’à -60% sur leurs plans à vie, mais surtout avec un pack 3en1 exclusif qui regroupe tout ce dont vous avez besoin pour sécuriser votre vie numérique.

    Et quand je dis “à vie”, c’est pas du marketing. Un seul paiement, et hop, vous êtes tranquille pour les 99 prochaines années alors que les autres vous pompent en moyenne 10 balles par mois… Là, vous réglez le problème une bonne fois pour toutes.

    Le pack 3en1 qui change tout

    pCloud lance donc pour ce Black Friday un pack exclusif qui envoie du lourd : 5 To de stockage + pCloud Encryption à vie + pCloud Pass à vie, le tout pour 599 € au lieu de 1498 €. Vous économisez donc 899 balles d’un coup, et vous avez la totale en termes de sécurité !

    Mais décortiquons un peu ce pack. Avec 5 To d’espace de stockage, vous avez de quoi stocker l’intégralité de vos photos et vidéos depuis la naissance de votre premier enfant jusqu’à ce qu’il parte de chez vous. pCloud Encryption chiffre également vos fichiers sensibles côté client avant même qu’ils ne partent sur les serveurs, ce qui veut dire que personne ne peut y accéder à part vous ! Et pCloud Pass, c’est, vous l’aurez compris, le gestionnaire de mots de passe qui vous évite de recycler ce bon vieux “Azerty1234” sur tous vos comptes.

    Les autres offres Black Friday

    Maintenant si ce pack 3en1 vous semble un peu trop ambitieux, pCloud vous propose aussi des plans individuels à vie avec des réductions intéressantes :

    • 1 To à vie : 199€ au lieu de 435€ (-54%)
    • 2 To à vie : 279€ au lieu de 590€ (-53%)
    • 10 To à vie : 799€ au lieu de 1890€ (-58%)

    Pour ceux qui calculent vite, 1 To chez Google Drive c’est environ 100 balles par an. Avec pCloud, vous payez 199 € une fois et c’est réglé. Donc au bout de 2 ans, vous êtes déjà gagnant et sur 10 ans, j’en parle même pas.

    pCloud Photos débarque et ça change tout

    pCloud vient aussi de sortir **une nouveauté qui va faire grincer **des dents chez Google. Il s’agit d’une fonctionnalité de galerie photo intelligente avec éditeur intégré, incluse dans tous les plans sans supplément.

    La galerie organise automatiquement pour vous, toutes vos images par date avec un flux chronologique. Vous pouvez ainsi naviguer par année, exclure certains dossiers pour ne pas mélanger vos screenshots avec vos vraies photos, et retrouver n’importe quel cliché en quelques secondes. Comme ça, c’est fini le bordel où les captures d’écran et les logos d’apps se retrouvent mélangés avec vos souvenirs de vacances.

    Et le plus chouette je trouve, c’est l’éditeur intégré. Vous modifiez vos photos directement dans pCloud sans avoir à installer Photoshop ou sortir votre CB pour un abonnement Adobe. Vous avez 8 filtres accessibles en un clic (Retrofilm, Vibrant, Vintage, Duotone, Coolbreeze, Redtint, Warmtone, Coldtone), des ajustements précis pour la luminosité, le contraste, les hautes lumières et les ombres, plus les outils classiques comme le recadrage et la rotation. Et tout ça en temps réel, directement dans votre stockage sécurisé.

    pCloud a donc clairement décidé de ne plus se contenter de stocker vos fichiers en transformant votre espace cloud en centre de gestion de photos, et tout ça sans avoir à passer par les serveurs de Google qui scannent vos images pour mieux vous balancer des pubs ciblées.

    pCloud Encryption : le coffre-fort

    Pour ceux qui manipulent des fichiers sensibles, pCloud Encryption est aussi un game changer. Le chiffrement se fait côté client, sur votre machine, avant même que les fichiers ne partent vers les serveurs. Vos clés de chiffrement restent donc uniquement entre vos mains et pCloud applique une politique de confidentialité stricte à “connaissance nulle” (zero knowledge), ce qui veut dire que même eux ne peuvent pas accéder à vos données chiffrées.

    C’est le niveau de protection qu’Edward Snowden recommanderait si on lui demandait son avis !

    pCloud Pass : le gestionnaire de mots de passe qui assure

    Inclus dans le pack 3en1, pCloud Pass simplifie également votre sécurité en ligne puisqu’il stocke tous vos mots de passe de manière chiffrée, génère automatiquement des mots de passe forts et uniques pour chaque compte, et remplit les formulaires de connexion en un clic.

    Compatible avec tous les appareils, navigateurs et systèmes d’exploitation, pCloud Pass synchronise vos mots de passe partout. Vous créez un mot de passe ultra-sécurisé sur votre PC, et il est ainsi immédiatement dispo sur votre smartphone. Comme ça, y’a plus besoin de noter vos bons vieux passwords sur ces petits carnets à mots de passe vendus à la FNAC que vos parents adorent vous offrir à Noël parce que vous êtes “geek”. lol

    pCloud Drive et les fonctionnalités qui tuent

    pCloud Drive transforme aussi votre espace cloud en disque virtuel accessible comme un SSD local. Compatible Windows, macOS et Linux, il synchronise vos fichiers instantanément sur tous vos appareils. Comme ça, si vous travaillez sur un document sur votre PC, il est immédiatement dispo sur votre smartphone. Et les apps mobiles iOS et Android uploadent automatiquement vos photos et vidéos pour libérer de l’espace sur votre téléphone.

    Avec pCloud Backup, vos fichiers importants sont sauvegardés en continu en arrière-plan comme ça, plus de prise de tête avec les sauvegardes manuelles. Vous collaborez facilement avec des liens sécurisés, même avec des gens qui n’ont pas pCloud. Le service compte deux centres de données, l’un aux États-Unis et l’autre au Luxembourg, et vous choisissez où vos fichiers sont stockés.

    Alors pourquoi pCloud plutôt que les GAFAM ?

    Et bien dans ce monde bizarre où Google, Microsoft et consorts se partagent vos données personnelles comme un gâteau d’anniversaire, pCloud arrive avec une approche très différente puisqu’ils sont basés en Suisse avec des serveurs au Luxembourg, et leur service respecte le RGPD et les lois suisses qui sont parmi les plus strictes au monde en matière de protection des données.

    pCloud possède également ses propres datacenters, donc pas de sous-location douteuse chez Amazon Web Services ou Google Cloud. Et ainsi, vos fichiers restent en Europe, soumis aux régulations européennes. Pas de scanning automatique pour cibler vos pubs, pas de vente de metadata à des tiers, mais juste du stockage qui respecte votre vie privée.

    Avec plus de 22 millions d’utilisateurs qui leur font confiance, pCloud a prouvé que le modèle “paiement unique + respect de la vie privée” fonctionnait. Et franchement, pouvoir dire “mes données sont au Luxembourg” plutôt que “j’sais pas trop où Google planque mes trucs”, c’est quand même plus classe.

    Comment profiter de l’offre Black Friday ?

    Hé bien c’est hyper simple ! Vous allez sur la page Black Friday pCloud , vous choisissez votre plan (le pack 3en1 si vous voulez la totale, ou un plan individuel si vous avez juste besoin de stockage), vous payez une fois, et c’est réglé comme he vous le disais, pour les 99 prochaines années.

    L’offre est valable du 17 au 29 novembre 2025 et si vous hésitez encore, pCloud propose une garantie satisfait ou remboursé.

    En tout cas, c’est l’occasion parfaite de reprendre le contrôle de vos données tout en faisant des économies. Et avec les nouvelles fonctionnalités Photos qui viennent de sortir, pCloud devient enfin une alternative crédible à Google Photos sans sacrifier votre vie privée.

    L’offre se termine le 29 novembre, alors ne traînez pas trop !

    → Profiter de l’offre Black Friday pCloud

    • ✇Korben
    • Vous vous souvenez du web d'avant ?
      Mais siiii, celui où on cliquait sur un lien et hop, la page s’affichait. Sans popup de cookies, sans overlay “Abonnez-vous à notre newsletter”, sans ce message agaçant “Désactivez votre bloqueur de pub pour continuer” ou “Abonnez-vous pour lire cet article”. Bref, l’époque bénie où internet était juste… internet. Le RGPD devait nous sauver de la surveillance mais le résultat c’est qu’on passe notre vie à cliquer sur des bouton “Tout refuser” ou à chercher le bouton caché derrière 47 onglets de

    Vous vous souvenez du web d'avant ?

    Par : Korben
    2 octobre 2025 à 17:39

    Mais siiii, celui où on cliquait sur un lien et hop, la page s’affichait. Sans popup de cookies, sans overlay “Abonnez-vous à notre newsletter”, sans ce message agaçant “Désactivez votre bloqueur de pub pour continuer” ou “Abonnez-vous pour lire cet article”. Bref, l’époque bénie où internet était juste… internet.

    Le RGPD devait nous sauver de la surveillance mais le résultat c’est qu’on passe notre vie à cliquer sur des bouton “Tout refuser” ou à chercher le bouton caché derrière 47 onglets de paramètres. L’enfer est pavé de bonnes intentions réglementaires, il parait… Mais heureusement, des extensions comme PopUpOFF existent pour réparer ce que cette loi a cassé.

    Ce que fait cette extension pour Chrome et Firefox, c’est virer les popups, les overlays, les bannières de cookies et toutes ces merdes qui transforment la navigation en parcours du combattant. RomanistHere, le dev derrière le projet, a créé ça tout seul dans son coin et son extension est dispo en open-source sur GitHub .

    PopUpOFF propose donc 3 modes de blocage : agressif, modéré et délicat. Le mode agressif, c’est le rouleau compresseur… il dégomme tout ce qui bouge. C’est super pratique quand vous êtes pressé.

    Le mode modéré quant à lui fait le tri entre les popups légitimes (genre, celles de votre banque) et les overlays parasites. Et le mode délicat, lui, intervient uniquement quand vous le décidez manuellement.

    Ainsi, vous gardez le contrôle total, ce qui change des extensions qui décident de tout ça à votre place.

    Alors bien sûr, tout n’est pas parfait et l’extension peut parfois rater des overlays invisibles ou péter l’affichage de certains sites, notamment les PWA (Progressive Web Apps), mais pour 90% des cas d’usage, ça fait le job impeccable.

    À l’opposé des mastodontes type Ghostery ou uBlock Origin (qui sont excellents, ne me faites pas dire ce que je n’ai pas dit…), RomanistHere a misé sur le minimalisme radical. Pas de filtres à mettre à jour toutes les semaines, pas de liste de 50 000 domaines à bloquer, pas de consommation RAM de malade. Non, c’est juste un script intelligent qui détecte les patterns d’overlays et les neutralise.

    Notez qu’en bonus, l’extension peut parfois débloquer du contenu payant sur certains sites qui utilisent des overlays pour bloquer la lecture. Ce n’est pas son objectif principal, mais vu que beaucoup de paywalls reposent sur des overlays CSS basiques, bah… PopUpOFF les vire aussi. Je dis pas que vous devriez l’utiliser pour contourner les abonnements (soutenez vos médias préférés, toussa toussa), mais sachez que techniquement, ça peut arriver.

    À noter que PopUpOFF n’est pas seul sur ce créneau. Il y a aussi “ I Don’t Care About Cookies ” (racheté par Avast, ce qui a refroidi pas mal de gens), ou encore la fonction “ Never-Consent ” de Ghostery qui auto-rejette les cookies via les CMP (Consent Management Platforms). Ces alternatives ont chacune leurs forces, mais PopUpOFF reste le champion du rapport efficacité/poids.

    Bref, si vous en avez marre de perdre 15 secondes par page à fermer des popups de merde, PopUpOFF mérite clairement sa place dans votre navigateur. C’est léger, c’est open-source, c’est gratuit, et ça fait exactement ce qu’on lui demande…

    • ✇Korben
    • Bientôt la fin des bandeaux RGPD ?
      Vous en avez marre de cliquer sur “Accepter les cookies” à chaque fois que vous visitez un site web ? Du genre vraiment marre, au point de parfois renoncer à lire un article plutôt que de devoir encore cliquer sur ces bannières ? Et bien si j’en crois Mashable , la Commission européenne envisage sérieusement de revoir la directive e-Privacy de 2009 qui nous a imposé cette avalanche de bandeaux moches. Enfin !! Il était temps qu’ils se réveillent à Bruxelles, parce que bon, l’intention de départ

    Bientôt la fin des bandeaux RGPD ?

    Par : Korben
    23 septembre 2025 à 09:30

    Vous en avez marre de cliquer sur “Accepter les cookies” à chaque fois que vous visitez un site web ? Du genre vraiment marre, au point de parfois renoncer à lire un article plutôt que de devoir encore cliquer sur ces bannières ? Et bien si j’en crois Mashable , la Commission européenne envisage sérieusement de revoir la directive e-Privacy de 2009 qui nous a imposé cette avalanche de bandeaux moches.

    Enfin !!

    Il était temps qu’ils se réveillent à Bruxelles, parce que bon, l’intention de départ était louable c’est sûr… Il s’agissait de protéger notre vie privée en nous demandant notre consentement avant de nous traquer. Sauf que dans les faits, on s’est tous retrouvés à cliquer frénétiquement sur “Accepter tout” juste pour pouvoir lire tranquillement notre article. C’est ce qu’on appelle la “cookie fatigue”, et elle a complètement détourné l’objectif initial de la loi, en plus de faire perdre des heures de travail à toute l’économie européenne .

    La Commission européenne explore donc plusieurs pistes pour simplifier tout ça. L’idée principale de leurs réflexions, ce serait de permettre aux utilisateurs de définir leurs préférences une bonne fois pour toutes dans les paramètres de leur navigateur. Fini les popups sur chaque site et vos navigateurs Chrome, Firefox, Safari et consorts deviendraient les gardiens de vos préférences cookies. Techniquement, c’est déjà possible avec le Do Not Track, mais personne ne l’utilise vraiment.

    Ça m’énerve vraiment de lire ça, car ces bandeaux cookies, c’était vraiment la pire implémentation qu’ils pouvaient mettre en place alors que depuis J-0 tout le monde leur gueule fort dans les oreilles “Mais bande de nazes, faut l’implémenter dans le navigateur”.

    Enfin, j’imagine qu’il vaut mieux tard que jamais.

    Bref, bientôt les affreux bandeaux cookies qui faisaient mouiller les ayatollahs du RGPD vont disparaitre… quelle bonne nouvelle ! Pour ma part, en ce qui concerne mon site, j’ai écrit à la CNIL (en recommandé svp !) en début d’année pour leur demander leur avis, afin de savoir si je respectais bien le RGPD. Je n’ai jamais eu de réponse de leur part (snif), mais de mon point de vue, de celui de lecteurs dont c’est le métier, de CookieViz , et de ma régie pub, j’étais pas trop mal.

    Après, depuis mon courrier à la CNIL y’a eu pas mal de changements quand même. J’sais pas si vous avez suivi mon actu, mais cet été, j’ai notamment retiré le bandeau des cookies.

    What ??? Suis-je un vil criminel ?

    Non, en fait c’est parce que j’ai supprimé tout ce qui était scripts de stats (Google analytics / Matomo) parce qu’elles n’avaient plus aucun sens vu que tout le monde les bloque… J’utilise également uniquement le player “no-cookies” de Youtube, et j’ai aussi enlevé toutes les bannières de pubs parce que c’est quelque chose que je voulais faire depuis loooongtemps. Ça me fait des revenus en moins c’est sûr (ouille), mais je compte sur mon Patreon pour contrebalancer ça.

    C’était pas une décision simple puisqu’un peu risqué, et j’espère que l’avenir me donnera raison. En plus, comme j’ai aussi totalement arrêté de partager mes articles sur mes comptes de réseaux sociaux , ça a provoqué également une jolie petite baisse de trafic. Après, contrairement à mes confrères de la presse tech, je ne suis pas équipé pour faire la course à l’audience vu que je suis à 99% tout seul à écrire, à gérer la technique, le code du site, faire rentrer la thune, et la gestion de ma boite…etc., donc bon, ça ne change pas grand-chose, toutefois ne plus avoir de publicités programmatiques, ça renforce encore cette absence d’enjeux liés au trafic et ça me fait un truc en moins à gérer.

    Par conséquent, le site est plus rapide à charger, il est visuellement plus joli (à mon goût), bref, j’en suis très content ! Et ça se ressent sur mes dernières stats (réalisées sans tracking car générées à partir des logs de mon serveur web), puisque mon site a enregistré au mois d’août (le pire mois de l’année à cause des vacances), 1,4 million de visiteurs uniques ! Du coup, je suis assez content et fier parce que ça veut dire que ce que j’écris vous intéresse et ça c’est cool !

    Voilà, je referme cette parenthèse sur le meilleur site Tech de France (hein, quoi ?? ^^) pour revenir à cette réforme européenne. Histoire d’avancer un peu, le Danemark a suggéré que les cookies “techniquement nécessaires” ou pour des “statistiques simples” ne devraient plus nécessiter de consentement. Ça paraît logique, mais faut pas oublier quand même que malgré tout, les données s’envolent aux États-Unis la plupart du temps (je pense à Google Analytics) et ça, c’est pas cool, donc j’espère qu’ils resteront vigilants là-dessus, même pour de simples stats.

    De leur côté, les lobbyistes de l’industrie Tech poussent fort pour avoir plus de marge de manœuvre afin de décider eux-mêmes de ce qui nécessite un consentement ou pas (lol, tu m’étonnes), mais forcément, les défenseurs de la vie privée tirent la sonnette d’alarme et je les rejoins là-dessus ! En effet, ces derniers craignent qu’on donne trop de pouvoir aux entreprises et qu’on se retrouve avec encore plus de tracking qu’avant, mais cette fois, sans qu’on le sache.

    Du coup, la vraie question pour le régulateur c’est de trouver l’équilibre entre une bonne protection de la vie privée et une expérience utilisateur fonctionnelle. Pas simple, mais le Do Not Track (ou un équivalent) pourra aider.

    Bref, est-ce qu’on verra disparaître ces satanées bannières RGPD ? Peut-être pas complètement, mais on pourrait au moins avoir quelque chose de plus intelligent qui permettrait de configurer une seule fois vos préférences dans Firefox ou Chrome, et hop, tous les sites respecteront automatiquement vos choix. Comme ça, plus besoin de cliquer sur quoi que ce soit… Les cookies strictement nécessaires passeront alors directement et les cookies marketing seront bloqués si vous l’avez décidé.

    Comme ça tout le monde sera content… enfin, j’imagine ?

    • ✇Korben
    • DNS4EU - L'alternative européenne à Google et Cloudflare
      Quand vous tapez korben.info dans votre navigateur, il se passe un petit truc aussi sympa qu’indispensable : votre DNS transforme ce nom en adresse IP. Le problème, c’est que c’est souvent Google (8.8.8.8) ou Cloudflare (1.1.1.1) qui s’en occupe… et donc qui sait tout de vos habitudes. Heureusement, l’Europe vient de dire stop à cette dépendance avec DNS4EU, son propre résolveur DNS qui promet de garder vos données chez nous.

    DNS4EU - L'alternative européenne à Google et Cloudflare

    Par : Korben
    9 juin 2025 à 21:45

    Quand vous tapez korben.info dans votre navigateur, il se passe un petit truc aussi sympa qu’indispensable : votre DNS transforme ce nom en adresse IP. Le problème, c’est que c’est souvent Google (8.8.8.8) ou Cloudflare (1.1.1.1) qui s’en occupe… et donc qui sait tout de vos habitudes. Heureusement, l’Europe vient de dire stop à cette dépendance avec DNS4EU, son propre résolveur DNS qui promet de garder vos données chez nous.

    • ✇LinuxFr.org : les dépêches
    • La virtualisation pour les nuls et autres enjeux autour des datacenters
      Depuis quelques années la virtualisation sous toutes ses formes est devenue l'alpha et l'oméga de l'informatique, elle a révolutionné en quelques années la manière d'administrer les serveurs et de gérer les données. Cette dépêche est un essai de vulgarisation sur la virtualisation pour en exposer ses grands principes techniques, ses avantages et inconvénients et ses enjeux sous-jacents. lien nᵒ 1 : VirtualisationSommaire Commençons par quelques définitions C'est quoi la virtualisation ? C'est

    La virtualisation pour les nuls et autres enjeux autour des datacenters

    Depuis quelques années la virtualisation sous toutes ses formes est devenue l'alpha et l'oméga de l'informatique, elle a révolutionné en quelques années la manière d'administrer les serveurs et de gérer les données. Cette dépêche est un essai de vulgarisation sur la virtualisation pour en exposer ses grands principes techniques, ses avantages et inconvénients et ses enjeux sous-jacents.

    Sommaire

    Commençons par quelques définitions

    C'est quoi la virtualisation ?

    Pour pouvoir illustrer concrètement ce qu'est la virtualisation, à une époque pas si lointaine que ça, dans le monde professionnel on retrouvait des serveurs physiques dédiés, par exemple un serveur pour gérer les mails, un autre pour le serveur web et un dernier comme serveur de fichiers. Chacun des serveurs pouvant tourner sur des systèmes d'exploitation (OS) différents. Dans notre exemple il en résulte qu'il faut maintenir et administrer trois machines différentes qui vont prendre de la place et consommer de l'électricité, sans une utilisation optimale de chacune des machines, si le serveur web par exemple a besoin momentanément d'un accroissement de puissance et de mémoire, il ne pourra pas bénéficier des ressources des autres serveurs physiques.
    Avec la virtualisation, sur une seule machine physique on va faire tourner plusieurs environnements de serveurs distincts en même temps, sans avoir à redémarrer, ils vont se partager les ressources matérielles de la machine physique de manière plus optimale et efficace en réduisant les coûts d'administration. On retrouvera donc sur une seule machine physique, nos serveurs de courriel, web et de fichiers, chacun dans un environnement distinct fonctionnant de manière autonome et isolée.

    C'est quoi une machine virtuelle ?

    On appellera chaque environnement distinct machine virtuelle, elle s'exécute sur une machine physique avec son propre système d'exploitation, ses applications et avec les ressources de la machine physique qu'on veut bien lui allouer (mémoire, puissance de traitement, stockage). On dit aussi que la machine physique est appelée machine hôte et les machines virtuelles sont des machines invitées. Une machine hôte peut faire tourner plusieurs machines invitées.
    Une machine virtuelle fonctionne comme n'importe quel poste informatique avec son OS qu'on peut mettre à jour, ses applications, ses paramètres système et on pourra à partir de la machine hôte accéder à toutes les machines virtuelles.

    C'est quoi un hyperviseur ?

    Pour que les machines virtuelles puissent s'exécuter indépendamment et utiliser les ressources de la machine hôte simultanément sans qu'elles interfèrent entre elles, il est nécessaire de rajouter une couche logicielle qui va gérer tout ça, c'est ce qu'on appelle un hyperviseur.
    Il existe deux types d'hyperviseur:

    • L'hyperviseur de type 1, ou bien encore hyperviseur de matériel nu (bare metal en anglais) est en interface direct avec l'ordinateur physique, cela sous entend que votre machine soit compatible (Intel VT pour les processeurs Intel et AMD-V pour les processeurs AMD). Dans le monde libre, proxmox est certainement l'hyperviseur de type 1 le plus connu.
    • L'hyperviseur de type 2 ou bien encore hyperviseur de matériel invité (host metal en anglais) fonctionne dans un système d'exploitation déjà préinstallé, c'est le cas par exemple de VirtualBox qui permet de faire tourner une instance de windows dans un environnement Linux.

    Un hyperviseur de type 1 est une couche logicielle très légère et offre de meilleures performances et est la solution privilégiée pour des serveurs en production, l'hyperviseur de type 2 est plutôt une solution destinée aux utilisateurs qui souhaitent tester d'autres systèmes d'exploitation ou faire tourner un logiciel sur un OS particulier sur un poste de travail classique. Mais rien ne vous empêche de faire tourner plusieurs machines virtuelles sur un hyperviseur de type 2 qui pourront communiquer entre elles et fonctionner comme un hyperviseur de type 1, à la différence qu'elles seront moins performantes.
    Par abus de langage, le terme d'hyperviseur fait référence plutôt à l'hyperviseur de type 1.

    C'est quoi les avantages de la virtualisation ?

    Une administration centralisée et facilitée

    L'hyperviseur fournit des outils de gestion des machines virtuelles qui simplifient sensiblement le travail d'administration, comme les outils de déploiement à partir de modèles de machines virtuelles, les outils de gestion de charge, de sauvegarde et de restauration de machines virtuelles.

    La disponibilité et la robustesse aux pannes

    Un autre avantage de la virtualisation est la fonctionnalité de migration à chaud, elle permet de déplacer une machine virtuelle d'une machine physique à une autre sans qu'il soit nécessaire de l'arrêter. Si un serveur physique présente des défaillances, les machines virtuelles sont automatiquement déplacées sur un autre hôte physique.
    Alors bien sûr si le serveur physique tombe en rade sans crier gare, la migration à chaud peut ne pas être opérante, dans ce cas on peut très bien envisager la mise en place d'une machine physique redondante sur laquelle les machines virtuelles sont répliquées et qui prendra le relais automatiquement si le serveur primaire tombe.

    L'amélioration des performances

    La migration à chaud évoquée plus haut a un autre avantage si une machine virtuelle est sursollicitée et nécessite de la puissance de traitement et de la mémoire, elle pourra être déplacée automatiquement sur un autre serveur moins sollicité à ce moment-là.

    La sécurité

    La virtualisation isole les services chacun dans leur machine virtuelle, en cas de corruption d'une machine virtuelle par cyberattaque, l'impact est nul pour les autres services et la restauration d'une machine virtuelle est autrement plus rapide et plus simple qu'avec une machine physique.

    La disparition des machines physiques

    Le stade ultime de la virtualisation est de déléguer à un prestataire la gestion des machines physiques qui se retrouve quelque part dans un datacentre. On s'abstrait totalement du matériel physique et des contraintes qui vont avec et on gère seulement nos machines virtuelles à distance, c'est totalement transparent pour les utilisateurs qui accèdent à leurs services via internet ou sur un réseau privé. On parle aussi d'infrastructure virtuelle.

    Il existe d'autres types de virtualisation ?

    On a surtout évoqué jusqu'à présent la virtualisation des serveurs, mais il existe également d'autres types de virtualisation comme:

    La virtualisation du stockage

    Cela consiste en la création d'un espace virtuel de stockage à partir d'installations physiques de stockage bien réelles comme les serveurs de fichiers, NAS ou SAN qu'ils soient locaux ou distants. Cela permet de mettre en commun toutes ces installations et de la gérer à partir d'un outil unique de gestion pour effectuer toutes les opérations de sauvegarde, réplication, d'archivage et de restauration.

    La virtualisation des réseaux

    Un réseau est composé d'un tas d'éléments actifs comme les commutateurs, les routeurs et autres pare-feux, de type et de marques différentes. Là aussi on va créer un réseau virtuel qui combine l'ensemble de ces éléments actifs physiques pour pouvoir centraliser leur gestion sans avoir à y accéder physiquement. La virtualisation des réseaux permettra également d'améliorer les performances du réseau avec des analyseurs de trafic qui pourront équilibrer la charge ou favoriser certains flux.

    La virtualisation des données

    Les données sont issues de diverses sources, ont chacune leur format et sont stockées sur différents supports locaux ou distants. La virtualisation des données est une couche logicielle qui va gérer l'ensemble de ces données de manière centralisée et les mettre à disposition des utilisateurs et des applications dans le format désiré.

    La virtualisation d'application

    La virtualisation d'application permet de séparer l'application de son système d'exploitation hôte et de fonctionner sur un poste utilisateur sans qu'elle soit installée. Dans la pratique l'application est installée sur un serveur centralisé et peut tourner sur un poste utilisateur du réseau comme si elle était installée localement, quand bien même l'OS du poste utilisateur n'est pas celui pour lequel l'application a été conçue.

    La virtualisation des postes de travail

    La virtualisation permet de virtualiser des serveurs mais pas seulement, on peut virtualiser également des postes de travail pour en faciliter la gestion qui seront accessibles aux utilisateurs du réseau via un client léger bien moins cher qu'un PC client classique.

    Autres concepts autour de la virtualisation

    C'est quoi une infrastructure convergée et hyperconvergée ?

    Une infrastructure convergée regroupe plusieurs composants informatiques traditionnels et bien physiques comme les serveurs de calcul, les dispositifs de stockage ou les éléments actifs réseau pour en assurer la gestion dans un tout cohérent. Cela simplifie la gestion de l'administration et ça optimise les ressources matérielles et logicielles. On dit que c'est une approche modulaire basée sur le matériel physique.
    L'hyperconvergence a une approche plutôt logicielle, elle intègre une couche logicielle qui va combiner les ressources de calcul, de stockage et de réseau dans ce qu'on appelle un nœud. Les nœuds sont interconnectés et combinés entre eux pour former des pools au sein d'un cluster, on retrouve ainsi un pool de stockage ou un pool de calcul, si un nœud venait à défaillir ça n'aurait pas de conséquence pour les autres nœuds et le fonctionnement du pool et du cluster.

    OK, mais une fois que tout ça est posé, quelle est la différence entre les deux ?
    L'infrastructure convergée a une approche basée sur le matériel physique, c'est à dire qu'un serveur physique peut être séparé du reste du dispositif et toujours fonctionner comme un serveur indépendant alors que ce n'est pas possible avec l'infrastructure hyperconvergée où les noeuds sont nécessairement interconnectés entre eux pour que le cluster puisse fonctionner correctement. Par ailleurs l'infrastructure convergée intègre de base d'autres fonctionnalités comme la sauvegarde, la réplication, la déduplication des données, la compression, l'optimisation du réseau, etc.

    C'est quoi un cluster haute disponibilité ?

    On a bien vu que finalement qu'elle soit dans vos locaux ou chez un prestataire de service, la machine physique reste le maillon faible du dispositif. Pour améliorer encore plus la disponibilité et la robustesse, on va dupliquer les machines physiques et si possible en les dispatchant dans des locaux et sites différents. Le tout étant géré comme un seul système. La virtualisation du stockage prend alors toute son importance, pour éviter de se rendre dépendant d'un serveur physique de données.

    C'est quoi le cloud computing ?

    On appelle cloud computing le fait de confier à un tiers sur internet la gestion de services informatiques (applications, stockage, outils de gestion, …) mais aussi le fait d'utiliser des services fournis par un prestataire via internet. Le cloud computing repose largement sur la virtualisation, on peut dire que le cloud computing est un environnement alors que la virtualisation est une technologique. En matière de cloud computing, il en existe de différentes sortes :

    • Infrastructure as a service (IaaS) ou infrastructure en tant que service : L'IaaS offre une infrastructure informatique complète (serveurs, stockage, réseau, …) sur un réseau privé (ressources en accès limité), public (ressources en accès libre) ou hybride (qui mélange les deux).
    • Platform as a service (PaaS) ou plate-forme en tant que service : Le PaaS c'est grosso modo la même chose que l'IaaS sauf qu'en plus on bénéficie d'outils supplémentaires pour pouvoir développer des applications qu'on retrouvera sur le cloud et tous un tas de services supplémentaires, gestion de base de données, aide à la décision, etc.
    • Le Software as a service (SaaS) ou logiciel en tant que service : Le SaaS est une offre logicielle complète qu'on retrouvera sur internet, c'est typiquement des offres comme Microsoft Office 365 ou Google Workspace, dans le monde opensource, on peut dire que certains prestataires recensés par les CHATONS se rapprochent d'une solution SaaS.

    NdM: il est question ici de cloud computing sur un cloud public, une infrastructure gérée par un hébergeur tiers. Il est aussi possible de faire du cloud computing privé, interne, dans une grosse structure qui en a la capacité, ce qui revient à déléguer l'hébergement à un tiers (des collègues dans ce cas). Et on peut combiner les deux pour faire du cloud hybride. Le cloud computing implique aussi la création de ressources en libre-service, de la facturation à l'usage et de la mutualisation.

    Les enjeux

    Enjeu environnemental

    L'adoption quasi généralisée de solutions autour de la virtualisation dans le monde professionnel a conduit à la disparition progressive des serveurs locaux d'entreprise au profit d'un développement effréné des datacenters de par le monde. Or un datacenter est constitué de machines bien physiques tournant 24h24 7j/7 avec tout un dispositif lui aussi bien physique pour assurer leur fonctionnement optimal, leur sécurisation et la robustesse aux pannes, il s'agit notamment de :

    • La climatisation et le traitement d’air pour maintenir des conditions satisfaisantes de température et hygrométrie avec toute un système de circulation et de refroidissement d'air
    • La distribution de l’électricité avec un dispositif de sécurisation en cas de coupure d'alimentation, souvent basé sur tout un ensemble d'onduleurs et appuyé par groupes électrogènes
    • la protection physique de l'installation avec contrôle d'accès, vidéosurveillance et autres systèmes anti intrusion

    Le tout nécessite une consommation électrique massive et une forte consommation en eau. Si l'on traduit cela en équivalent d'émission de gaz de serre (GES), d'après une étude de l'ADEME les datacenters ont déjà atteint le même niveau d'émission que le transport aérien à l'échelle mondiale.
    Il se trouve que le destin des datacenters est maintenant également étroitement lié à celui de l'IA, même si dans ce domaine on envisage plutôt des datacenters dédiés, or les besoins générés par l'IA dopent l'expansion globale des datacenters dans le monde. La demande de puissance de calcul de l'IA est exponentielle et double tous les 3,4 mois selon OpenAI. Selon une étude Gartner citée par le Monde Informatique, rien que les besoins liés à l'IA feront exploser la demande énergétique des datacenters au point que les fournisseurs d'énergie ne pourront y répondre dès 2027 !

    Dans ce contexte il n'est pas étonnant donc que les grands acteurs du secteur poussent au développement des centrales nucléaires qui leur permettra par la même occasion de verdir leur image. Mais ces acteurs ne sont pas à une contradiction près, on peut s'étonner du développement dans certaines régions qui de prime abord ne se prêtent pas particulièrement à leur installation contrairement aux pays nordiques. Le projet d'installation de Meta dans une région aride d'Espagne où chaque goutte d'eau compte, en est une triste illustration. Les températures régionales élevées décupleront ses besoins en électricité et en eau pour les circuits de refroidissement alors que la région souffre de sécheresse chronique. On peut déplorer que tout cela ne pourrait se faire sans le soutien des gouvernements et des élus locaux qui ne trouvent rien à redire.

    Enjeu de résilience

    Le marché actuel est dominé par trois acteurs qui représentent à eux trois plus de 60% du marché mondial il s'agit dans l'ordre d'AWS (Amazon), d'Azure (Microsoft) et de Google Cloud Platform, on parle d'eux comme des hyperscalers car ils fournissent des services à l'échelle mondiale à grande échelle. Cette hyperconcentration des acteurs et des solutions techniques fragilise l'économie mondiale en la rendant davantage sensible et moins résiliente aux pannes, la défaillance d'un simple outil de sécurité a ainsi entraîné en cascade une panne informatique mondiale en juillet dernier avec des conséquences graves comme l'arrêt partiel du contrôle aérien, de centres d'appels d'urgence ou de services hospitaliers. Plus modestement l'incendie subi par OVH en 2021 a impacté des milliers d'entreprise et services publics, toutes les données contenues sur les serveurs sont perdues, puisqu'OVH a commis l'erreur de stocker au même endroit les données et les sauvegardes. NdM: historique de pannes GCP, AWS ou Azure
    Cette hyperconcentration fait planer également des risques en termes de cybersécurité, la corruption d'un élément du système et sa prise de contrôle par un hacker aura vite des conséquences majeures.

    Enjeu de souveraineté

    Il faut savoir que les données gérées par un datacenter sont soumises à la réglementation propre au pays où il est installé. Les autorités aux États-Unis, au nom du Patriot Act peuvent donc ainsi accéder aux données stockées sur leur territoire. Les datacenters souverains sont donc un enjeu majeur pour certains pays pour garantir que les données seront protégées par les lois nationales, sans ingérence étrangère possible.

    En France notamment, 71% des entreprises se reposent sur des solutions américaines dont des acteurs étatiques. Une affaire illustre à elle seule cet état de fait, la solution Azure de Microsoft a été ainsi choisi pour héberger l'ensemble des données de santé de 4 établissements hospitaliers (et non de l'ensemble des Français) à des fins de recherche dans un entrepôt de données de santé dénommé EMC2. Sauf qu'en l'espèce Microsoft a répondu à un appel d'offre en bonne et due forme, que la CNIL a donné son autorisation et que les différents recours à ce stade ont tous échoué. Néanmoins voici ci-dessous texto la conclusion du rapport de la CNIL en 2023 :

    (début de citation)

    • qu’aucun prestataire potentiel ne propose d’offres d’hébergement répondant aux exigences techniques et fonctionnelles du GIP PDS (Note de l'auteur : groupement d’intérêt public « Plateforme de données de santé", appelé aussi Health Data Hub) pour la mise en œuvre du projet EMC2 dans un délai compatible avec les impératifs ce dernier ;
    • que le développement d’un démonstrateur " cloud de confiance ", respectant les conditions de la circulaire précitée et permettant à terme d’héberger des projets de cette nature, et notamment la plateforme du GIP PDS, devrait se poursuivre sur les prochaines années ;
    • que la construction d’une plateforme d’hébergement spécifique pour le projet EMC2 pourrait retarder la migration de la solution d’hébergement du GIP PDS pour l’ensemble de ses missions ;
    • qu’en attendant cette migration, le projet EMC2 soit mené sur la solution technique actuelle du GIP PDS.

    À la lumière de ces conclusions, la CNIL déplore qu’aucun prestataire susceptible de répondre actuellement aux besoins exprimés par le GIP PDS ne protège les données contre l’application de lois extraterritoriales de pays tiers.
    De manière générale, elle regrette que la stratégie mise en place pour favoriser l’accès des chercheurs aux données de santé n’ait pas fourni l’occasion de stimuler une offre européenne à même de répondre à ce besoin. Le choix initial du GIP PDS, dès sa fondation, de recourir au cloud a conduit à privilégier des offres d’acteurs étasuniens dont il apparaît désormais difficile de se détacher à court terme malgré l’émergence progressive de fournisseurs souverains. Le projet EMC2 aurait pu être retenu par le GIP PDS pour préfigurer la solution souveraine vers laquelle il doit migrer.

    (fin de citation)

    À la lumière de cette conclusion, on peut comprendre que la CNIL s'est sentie contrainte et forcée de répondre favorablement pour ne pas faire capoter ce projet en espérant que cette solution ne soit que transitoire et qu'elle pourra basculer sur une solution souveraine dans quelques années.
    Autre affaire d'actualité, le contrat entre EDF et AWS pour le stockage de certaines informations sensibles de maintenance du parc nucléaire français, le Canard enchaîné vient de révéler récemment que le contrat battait de l'aile car Amazon refuse d'inscrire noir sur blanc dans le contrat que les données d'EDF seront stockées en France (autre article).
    Aussi la France cherche à développer son "cloud souverain" pour ne plus être dépendant des géants américains mais peine à avancer sur le sujet faute de barrières réglementaires et juridiques, de réticences des élus et des populations sur les territoires pouvant accueillir des datacenters et d'une certaine frilosité des banques et acteurs technologiques.

    En guise de réponse aux enjeux

    Réponse à l'enjeu environnemental

    Pour ne pas courir à la catastrophe annoncée, la mise en place de technologies plus efficaces et économes en énergie est un enjeu majeur, parmi les axes d'innovation on peut citer:

    • l'utilisation d'énergie renouvelable
    • le refroidissement des datacenters basé sur des technologies peu gourmandes en eau,
    • la réutilisation de l'énergie dissipée par les datacenters.

    Réponse à l'enjeu de résilience

    Des normes et des certifications se sont mises en place qu'elles soient internationales, européennes ou nationales. On peut citer :

    • TIA 942 qui couvre différents domaines comme la disponibilité, la sécurité, l'efficacité énergétique, le refroidissement, la redondance et la gestion de l'espace;
    • ANSI/BICSI-002 qui définit des standards de conception et de pose des systèmes de câblage, d'électricité, dissipation de chaleur, refroidissement, etc.
    • ISO 27001 qui couvre la gestion de la sécurité de la donnée;
    • ISO 22237 qui couvre l'installation et les infrastructures des datacenters;
    • le référentiel de sécurisation des services cloud SecNumCloud élaboré par l’ANSSI;
    • la certification d'Uptime Institute avec sa classification du niveau de sécurité des datacenters de Tier I à Tier IV.

    En France, France Datacenter est une organisation professionnelle qui fédère les entreprises qui conçoivent, construisent et exploitent les datacenters. Elle publie également des guides à destination de ses adhérents qui font référence, on peut citer notamment "le livre blanc sur la sécurité incendie" ou "l'humain et la sécurité du datacenter".

    D'un point de vue réglementaire, on peut citer :

    • le règlement général sur la protection des données RGPD;
    • La directive européenne relative à DEE l’efficacité énergétique DEE;
    • La directive européenne relative à la sécurité des réseaux et de l’information, dite NIS 2 pour Network and Information System Security.

    Le respect de ces normes, certification et a fortiori de la réglementation sont une garantie que les datacenters sont construits suivant les règles de l'art avec le niveau de qualité, de sécurité et de fiabilité attendu. A ce propos pour en revenir à l'incident OVH, les procédures judiciaires qui en ont découlé et qui ont conduit à la condamnation d'OVH ont mis en évidence que la société qui se targuait d'être certifié ISO 27001 n'a pas respecté la norme pour ne pas avoir prévu une copie de sauvegarde sur un site distant.

    Réponse à l'enjeu de souveraineté

    Le respect du RGPD et de la certification SecNumCloud sont une première réponse à la menace des lois extraterritoriales sur la confidentialité des données, en parallèle le premier ministre de l'époque a diffusé en 2021 une circulaire relative à la doctrine d'utilisation de l'informatique en nuage par l'État qui a été actualisé en 2023. Cette dernière "exige (…) en cas de recours à une offre commerciale d'informatique en nuage, l'hébergement des données d'une sensibilité particulière par des solutions disposant de la qualification SecNumCloud (…) et immunisées contre toute réglementation extracommunautaire".
    Il faut par ailleurs créer l'environnement pour que des acteurs locaux puissent se développer et former une alternative crédible aux hyperscalers. L'émergence d'acteurs alternatifs de proximité est donc un enjeu que le marché seul ne suffit pas à faire percer, il faut une volonté politique, une stratégie et une vision à long terme, des financements, une adaptation de la réglementation à l'échelle européenne et nationale.
    À ce sujet le précédent gouvernement avait concocté une loi de simplification de la vie économique destinée à faciliter l'installation de datacenters en France en les qualifiant de projets d'intérêt national majeur (PINM) pour qu'ils puissent bénéficier de mesures dérogatoires, de procédures accélérées tout en contournant le pouvoir des élus locaux puisque ça sera l’État qui signera les permis de construire. Avec cette loi la métropole de Rennes n'aurait sans doute pas pu refuser l'implantation d'un datacenter de Microsoft s'il avait été jugé d'intérêt national. Aujourd'hui ce projet de loi continue son bonhomme de chemin législatif malgré l'instabilité politique actuelle.
    Cet objectif de développement d'une offre de proximité n'est pas forcément compatible des objectifs environnementaux et de développement durable que la France s'est imposée, mais il faut voir ça comme une opportunité pour innover et ne plus être à la traîne des États-Unis dans ces domaines technologiques.

    En guise de conclusion

    D'une simple présentation technique autour de la virtualisation, on en arrive en tirant la pelote à des considérations à fort enjeu sur la gestion et la confidentialité des données que bien des utilisateurs de cloud n'imaginent pas, ni même ne considèrent à sa juste importance. Pourtant il suffirait qu'ils en prennent conscience pour orienter leur choix vers des solutions respectueuses qui peinent encore aujourd'hui à émerger malgré les vœux pieux de l’État qui n'est pas toujours exemplaire dans le domaine.

    Pour aller plus loin

    Quelques pages de vulgarisation

    Une sélection de sites sur les enjeux et le futur autour de la virtualisation et les datacenters

    Sites divers

    Commentaires : voir le flux Atom ouvrir dans le navigateur

    • ✇LinuxFr.org : les dépêches
    • On passe 575 millions d’heures par an à cliquer sur les bandeaux cookies en Europe !
      Une récente analyse révèle que l’on consacre annuellement plus de 575 millions d’heures à cliquer avec les bannières de cookies en Europe. Ces bannières, imposées par la Directive ePrivacy 2002/58, visent à obtenir le consentement éclairé des utilisateurs avant de stocker ou d’accéder à leurs informations. Bien que l’objectif soit de renforcer la protection de la vie privée, l’impact réel sur la confidentialité des utilisateurs est limité, car la majorité des bannières servent principalement à d

    On passe 575 millions d’heures par an à cliquer sur les bandeaux cookies en Europe !

    Une récente analyse révèle que l’on consacre annuellement plus de 575 millions d’heures à cliquer avec les bannières de cookies en Europe. Ces bannières, imposées par la Directive ePrivacy 2002/58, visent à obtenir le consentement éclairé des utilisateurs avant de stocker ou d’accéder à leurs informations. Bien que l’objectif soit de renforcer la protection de la vie privée, l’impact réel sur la confidentialité des utilisateurs est limité, car la majorité des bannières servent principalement à des fins d’analyse web, de gestion de la publicité ou de suivi du trafic.

    Les pertes de temps se traduisent par un coût économique total d’environ 14,35 milliards d’euros par an, représentant 0,10 % du PIB annuel de l’UE. En termes de productivité, cela équivaut à une entreprise de 287 500 employés passant 8 heures par jour à cliquer sur ces bannières.

    Contrairement à une croyance populaire, les bannières de cookies n’ont pas été introduites par le RGPD mais par la Directive ePrivacy de 2002 qui n’a pas été mise à jour malgré de très nombreuses critiques.

    Aujourd’hui, la plupart des sites utilisent des bannières cookies pour un suivi interne plutôt que pour un suivi massif des utilisateurs. Cependant, la multiplicité de demandes de consentement entraîne une frustration générale et une fatigue de consentement, où les utilisateurs acceptent souvent sans réflexion, sapant totalement l’objectif initial de protection de la vie privée.

    NdM : l’article pointé conclut que le coût économique est conséquent et que le gain en vie privée est faible, et qu’il faut légiférer en révisant la directive ePrivacy. Les propositions sont orientées (exceptions pour les PME et les besoins basiques publicitaires). Dans l’absolu, les citoyens et les utilisateurs (pour regarder les deux angles) passent des millions d’heures sur des bandeaux de cookies, mais aussi à lire des conditions générales d’utilisation (CGU), en attention détournée par des pubs et des popups, etc. Ensuite on peut discuter pour savoir si on supprime la législation existante, si on la modifie et comment (variations suivant les choix politiques possibles), si on interdit, ou si on compte sur le marché pour s’auto-décider à ne pas le faire de lui-même (insérer des rires ici). Rappel : on n’est pas obligés de collecter des données personnelles d’une part, et d’autre part tous les cookies ne nécessitent pas le recueil du consentement préalable (voir les exceptions). Et un exemple récent montrant une mauvaise gestion avec un bandeau de cookie pour gérer uniquement le cookie du bandeau de cookie (et ça ce n’est pas un souci de la législation).

    Commentaires : voir le flux Atom ouvrir dans le navigateur

    • ✇LinuxFr.org : les dépêches
    • Règles de pérennité des comptes LinuxFr.org, données à caractère personnel et effet un an
      En février 2023, nous annoncions la mise en place d’une durée de conservation des données à caractère personnel (DCP) sur LinuxFr.org, avec à partir du 28 juin 2023 : fermeture des comptes inactifs pendant trois ans et suppression de leurs données conservées inutiles au service ; suppression des données associées inutiles au service pour les comptes fermés depuis plus d’un an. L’aide du site explique : Quelles sont les données à caractère personnel (DCP) traitées par le site ? Quelles sont

    Règles de pérennité des comptes LinuxFr.org, données à caractère personnel et effet un an

    En février 2023, nous annoncions la mise en place d’une durée de conservation des données à caractère personnel (DCP) sur LinuxFr.org, avec à partir du 28 juin 2023 :

    • fermeture des comptes inactifs pendant trois ans et suppression de leurs données conservées inutiles au service ;
    • suppression des données associées inutiles au service pour les comptes fermés depuis plus d’un an.

    L’aide du site explique :

    Depuis le 31 mai 2023, une information de date de dernière activité est associée à chaque compte. Ajoutons que depuis septembre 2023 l’accès à cette information est aussi réduite au besoin du service (on peut connaître l’info de son propre compte ; les admins ont seulement besoin de savoir si la dernière activité date de moins d’un mois, d’un an, trois ans ou plus, en raison des règles précitées).

    Nous voici donc un an après, et cette partie de la règle s’applique donc pour la première fois. Nous détaillerons les effets dans la seconde partie de la dépêche.

    Sommaire

    Script de minimisation des données et semaine normale

    La suppression des données inutiles au service repose actuellement sur un script de minimisation externe, lancé manuellement. Une des raisons de l’aspect manuel est notamment le fait que l’on n’avait pas encore passé la première année, qui marque un seuil comme nous le verrons plus tard.

    La précédente exécution du script ayant eu lieu le 19 mai 2024 à 11h (Paris), voyons ce que ça donne sur 12 jours et quelques heures :

    Started at vendredi 31 mai 2024, 22:19:15 (UTC+0200)
    Dry run mode
    13 inactive accounts never used to purge
    0 users to minimize
    0 accounts to minimize because inactive and not seen since 1 year
    0 active accounts not seen since 3 years to inactivate and minimize
    12 users without comments/contents to purge
    12 accounts to purge
    6 logs to purge
    12 friendly_id_slugs to purge
    0 taggings to purge
    0 oauth_access_grants for an oauth_application to purge
    0 oauth_access_tokens for an oauth_application to purge
    0 oauth_applications to purge
    0 oauth_access_grants to purge
    0 oauth_access_tokens to purge
    0 deleted comments to minimize
    0 comments from non-public contents to purge
    0 taggings from non-public contents to purge
    0 wiki_versions from non-public wiki_pages to purge
    0 slugs from non-public wiki_pages to purge
    0 non-public wiki_pages to purge
    0 slugs from non-public trackers to purge
    0 non-public trackers to purge
    0 slugs from non-public posts to purge
    0 non-public posts to purge
    0 poll_answers to from non-public polls to purge
    0 slugs from non-public polls to purge
    0 non-public polls to purge
    0 slugs from non-public bookmarks to purge
    0 non-public bookmarks to purge
    0 slugs from non-public diaries to purge
    0 diaries converted into non-public news to purge
    0 non-public diaries to purge
    1 news_versions from non-public news to purge
    10 paragraphs from non-public news to purge
    0 links from non-public news to purge
    1 slugs from non-public news to purge
    1 non-public news to purge
    1 non-public contents to purge
    

    En fonctionnement pré-« 1 an », on a seulement quelques comptes créés mais jamais utilisés à nettoyer (ainsi que tout ce qui y est associé, donc les comptes « accounts », les individus « users », les logs associés « logs » s’il y en a, les raccourcis pour les adresses du site « slugs ») et les contenus, commentaires et étiquetages associés non publics donc non visibles qui ne sont plus nécessaires. On parle donc d’une poignée de comptes et autres par semaine.

    Effet « 1 an »

    Quelques heures plus tard, le résultat n’est plus du tout le même :

    Started at Sat Jun 1 10:55:34 CEST 2024
    Dry run mode
    15 inactive accounts never used to purge
    250 users to minimize
    2616 accounts to minimize because inactive and not seen since 1 year
    0 active accounts not seen since 3 years to inactivate and minimize
    1412 users without comments/contents to purge
    1412 accounts to purge
    2285 logs to purge
    1412 friendly_id_slugs to purge
    6 taggings to purge
    0 oauth_access_grants for an oauth_application to purge
    0 oauth_access_tokens for an oauth_application to purge
    0 oauth_applications to purge
    15 oauth_access_grants to purge
    47 oauth_access_tokens to purge
    147 deleted comments to minimize
    98 comments from non-public contents to purge
    288 taggings from non-public contents to purge
    0 wiki_versions from non-public wiki_pages to purge
    0 slugs from non-public wiki_pages to purge
    0 non-public wiki_pages to purge
    0 slugs from non-public trackers to purge
    0 non-public trackers to purge
    166 slugs from non-public posts to purge
    165 non-public posts to purge
    10 poll_answers to from non-public polls to purge
    2 slugs from non-public polls to purge
    2 non-public polls to purge
    46 slugs from non-public bookmarks to purge
    46 non-public bookmarks to purge
    27 slugs from non-public diaries to purge
    0 diaries converted into non-public news to purge
    27 non-public diaries to purge
    139 news_versions from non-public news to purge
    1278 paragraphs from non-public news to purge
    33 links from non-public news to purge
    66 slugs from non-public news to purge
    61 non-public news to purge
    301 non-public contents to purge
    

    On a certes gagné 2 comptes jamais utilisés de plus à nettoyer, mais surtout on va minimiser plusieurs milliers de comptes et supprimer ou minimiser des centaines de contenus, commentaires et étiquetages. C’est le moment où la main ne doit pas trembler et où l’on doit avoir confiance dans le script de nettoyage et dans nos sauvegardes de la base de données, parce qu’il va falloir l’exécuter pour de vrai, et pas juste en mode « dry run » ou répétition, test à vide.

    En pratique, quelques soucis très mineurs rencontrés sur la grosse transaction faite en base de données : un problème d’ordre de suppression et l’impossibilité de mettre une chaîne vide pour l’adresse de courriel, car il y a un index dessus qui demande l’unicité (une adresse .invalid propre à chaque compte sera donc utilisée).

    Après l’exécution, si on relance le script, on se retrouve juste avec le nombre de comptes encore ouverts mais sans activité depuis un an :

    Started at Sat Jun 1 13:30:16 CEST 2024
    Dry run mode
    0    inactive accounts never used to purge
    0    users to minimize
    905  accounts to minimize because inactive and not seen since 1 year
    (…)
    

    Ça change quoi ?

    Regardons les statistiques des comptes avant et après le nettoyage « 1 an » (les évolutions ont été mises en visibilité avec un point rouge) :

    Avant/après sur les statistiques des comptes

    Interprétation : il s’agit des états des comptes par ordre d’identifiant en base de données (temporellement dans l’ordre de création), regroupés par paquets de 10 000 consécutifs. Quasiment pas de modification sur les comptes très anciens (il y en a beaucoup moins), et les changements se concentrent sur les comptes des dernières années. On a moins de comptes fermés après (on a pu en purger) et donc plus de comptes purgés (c’est-à-dire d’identifiants qui ne sont plus utilisés en base). Et le reste des changements correspond aux visites nominales du site.

    On peut comparer les statistiques juste avant :

    53667 utilisatrices et utilisateurs ayant ou ayant eu des comptes (et encore présents en base de données)
    33216 comptes
    2205 comptes utilisés sur le site au cours des trois derniers mois avec 20.2 jours de moyenne sans visite et 25.3 jours d’écart‑type
    10 comptes en attente
    2809 comptes fermés

    Et les actuelles (au moment de la rédaction de cet article) :

    51943 utilisatrices et utilisateurs ayant ou ayant eu des comptes (et encore présents en base de données)
    31492 comptes
    2208 comptes utilisés sur le site au cours des trois derniers mois avec 20.0 jours de moyenne sans visite et 25.3 jours d’écart‑type
    1 compte en attente
    1089 comptes fermés

    Nous avons aussi réoptimisé les tables de la base de données (enfin on a dit à la base d’optimiser ce qu’elle pouvait avec un OPTIMIZE TABLE quoi). Ça devrait avoir entre une absence d’effet et un effet imperceptible sur les performances, a priori.

    Et côté sauvegarde, on est passé d’un dump compressé gzip de 2 088 253 834 octets avant à 2 086 608 391 octets après, soit un gain faramineux de 0,08 %, bref rien.

    Et après ?

    Une fois « 1 an » passé, on aura chaque semaine les quelques comptes créés mais jamais utilisés à nettoyer, ainsi que les quelques contenus, commentaires et étiquetages associés non publics non nécessaires. Mais aussi les comptes qui auront atteint l’année d’inactivité dans la semaine courante (probablement une ou deux dizaines). Et ce jusqu’aux « 3 ans ».

    À partir des « 3 ans », on va commencer à fermer des comptes et il y aura encore plus de données concernées chaque semaine.

    Et ensuite on aura atteint le rythme nominal de fermeture de comptes et de minimisation de données associées.

    Rendez-vous pour les « 3 ans » en juin 2026 donc.

    Commentaires : voir le flux Atom ouvrir dans le navigateur

    • ✇Korben
    • Sauvegardez facilement votre parc machines avec Arx One
      — Article en partenariat avec Arx One — Arx One est une solution de sauvegarde permettant aux petites comme aux grandes entreprises de protéger les données de leur parc machines. Conçue et développée en France, cette suite complète d’outils permet de sauvegarder simplement et efficacement tous types de données, peu importe la machine où elles se trouvent. L’outil s’appuie en premier lieu sur une console centrale. C’est elle qui permet de superviser et d’administrer l’ensemble machines et

    Sauvegardez facilement votre parc machines avec Arx One

    Par : Korben
    29 mai 2024 à 10:42

    — Article en partenariat avec Arx One —

    Arx One est une solution de sauvegarde permettant aux petites comme aux grandes entreprises de protéger les données de leur parc machines. Conçue et développée en France, cette suite complète d’outils permet de sauvegarder simplement et efficacement tous types de données, peu importe la machine où elles se trouvent.

    L’outil s’appuie en premier lieu sur une console centrale. C’est elle qui permet de superviser et d’administrer l’ensemble machines et leur sauvegardes. À travers cette console d’administration, on peut définir, entre autres, les machines à rattacher, la politique de sauvegarde, les plannings, les points de restauration, etc.

    Ensuite, il y a les agents qui ce sont de petits logiciels discrets, déployés sur les machines à sauvegarder (Windows, Linux, macOS…) qui sont alors capables de réaliser des sauvegardes selon les paramètres définis à distance dans la console. Les données sont évidemment dé-dupliquées et tout est chiffré à la source avant d’être envoyées vers le stockage distant.

    La solution est particulièrement adaptée aux boites qui manipulent des données sensibles et qui doivent les sécuriser (données de santé, données financières…) car tout est stocké sur le sol français. C’est parfait aussi pour les sociétés qui doivent respecter des normes strictes en termes de sécurité et de conformité (ISO27001, HDS, RGPD…).

    Arx One est très complet puisqu’il permet ainsi de sauvegarder des choses aussi diverses que :

    • Des serveurs physiques Windows et Linux
    • Des machines virtuelles Proxmox, Hyper-V
    • Des postes de travail et ordinateurs portables Windows, macOS, Linux
    • Des NAS Synology, QNAP
    • Et également des applications telles que des bases de données (MySQL, HFSQL, SQL Server…etc.), des messageries Exchange / Microsoft 365, etc.

    Ensuite, pour le stockage, Arx One offre 2 possibilités. Soit de la sauvegarde externalisée et dans ce cas là, les données sont stockées dans leur cloud sécurisé. Ce sont leurs propres serveurs situés dans des datacenters en France (Nantes et Lyon) ce qui permet d’offrir à leur client un cloud souverain, certifié ISO27001 et HDS (Hébergeur de Données de Santé).

    Ou sinon, y’a aussi moyen d’opter pour la sauvegarde centralisée. et dans ce cas, les données sont stockées sur vos propres infrastructures de stockage et tout est géré par vous.

    Quoiqu’il en soit, dans les 2 cas, vos données seront toujours sécurisées avec du chiffrement de bout en bout en AES256, de la déduplication, des mises à jour automatique, des tests d’intégrité, une conformité RGPD, et ainsi de suite.

    Alors maintenant comment ça s’installe ? Et bien j’ai fait des tests et je vais vous parler de mon expérience. J’ai commencé par la console de gestion qui s’installer en 2 secondes sur n’importe quel Windows. C’est cette machine qui fait alors office de poste de gestion central.

    Visuellement, ça fonctionne sur un principe d’onglet comme un navigateur. L’écran de bienvenue permet de visualiser d’un seul coup d’oeil l’ensemble du parc des « agents », les opérations de backup ou de restauration en cours et les problèmes éventuels, ainsi que la place restante sur les serveurs d’Arx One pour le stockage. À partir de là, on commence à administrer des comptes et leur appliquer des stratégies de sauvegarde (j’y reviendrai plus tard). L’idée c’est que pour chaque machine à sauvegarder, vous allez devoir créer un compte descendant. Ce sont des comptes qui sont rattachés à votre compte principal. 1 compte par agent et donc par machine.

    Une fois tout ça crée, y’a plus qu’à installer les agents sur les machines. Cela peut se faire en récupérant un binaire pour Windows, macOS ou Linux sur le site de Arx One, ou en lançant quelques lignes de commande si vous voulez par exemple déployer ça sur un serveur ou sur un NAS. La documentation concernant les agents est ici.

    Ensuite, y’a plus qu’à rattacher votre agent à la console en saisissant au moment de l’installation de l’agent, l’identifiant du compte descendant et son mot de passe créé pour l’occasion. Pensez à bien rafraîchir la console pour avoir les données à jour ensuite.

    Après au niveau de l’usage, la console web offre une excellente supervision et cela en temps réel. On peut y voir tous les agents rattachés, les paramétrer, mais également afficher différents tableaux de bord qui permettent d’avoir une bonne vue d’ensemble de l’état des sauvegardes, de l’espace de stockage qu’il vous reste, des derniers points de restauration, mais également de voir les alertes (sauvegarde en erreur, espace disque faible…).

    Et bien sûr, même si on ne le souhaite pas, à un moment, il faudra restaurer des données. Et bien encore une fois, tout peut se faire à distance via la console. Il suffira de sélectionner les fichiers à récupérer et d’indiquer à l’outil leur destination. La restauration sera alors lancée sur le poste ou le serveur distant.

    Concernant les stratégies de sauvegarde, c’est peut-être la partie la plus barbue de l’outil puisque cela va nécessiter de lire la documentation, mais si vous êtes administrateur système, vous avez forcément l’habitude de ce genre de chose. En gros, c’est une série de clés et de valeurs que vous pouvez définir pour permettre à l’agent plus ou moins de choses comme l’accès à l’interface, la sauvegarde continue, la taille maximale des objets à sauvegarder, l’endroit où sera créé le cache local…etc.

    Voici un exemple qui permet d’avoir une sauvegarde continue sur les documents, avec un délai de déclenchement à 60 secondes, une taille max de fichiers à sauvegarder de 50 MB sans éclater le quota de 10 GB autorisé :

    Voilà pour le tour d’horizon… Arx One est donc un excellent choix pour vos sauvegardes qui a réussi à éviter le côté usine à gaz d’autres solutions concurrentes que j’ai pu tester par le passé. Ça se déploie facilement, et le fait que le sauvegarde puisse être externalisée chez eux (en France !), de manière chiffrée et sécurisée, ça élimine pour leurs clients, la problématique parfois épineuse de la gestion et de la sécurisation du stockage.

    Si ça vous dit de tester Arx One, je vous invite à cliquer ici pour en savoir plus.

    ❌
    ❌