Bêta publique - Voir notre annonce

Transformez n'importe quelle page web en texte propre.

Danubia est une API de scraping et d'extraction de contenu pour développeurs. Envoyez une URL et recevez du markdown propre, à la demande ou en lot.

Une requête. Du texte propre en retour.

Requête

curl -X POST https://app.danubia.tech/api/v1/demo \
  -H "Content-Type: application/json" \
  -d '{"url": "https://github.com/trending"}'

Réponse en direct

Appuyez sur Lancer pour récupérer une vraie page.

Des données prêtes pour les LLM

Le contenu principal de la page en markdown propre, en HTML ou en texte brut, accompagné de métadonnées structurées, prêt à nourrir vos modèles, index et agents.

Poli par conception

robots.txt respecté et appliqué, avec des limites de concurrence strictes par domaine. Nous crawlons comme les sites veulent être crawlés.

Conçu dans l'UE 🇪🇺

Des serveurs dans l'Union européenne, conformes au RGPD par défaut. Vos données ne quittent jamais l'Union.

Cas d'usage

Ce que vous pouvez construire avec Danubia

Si votre produit a besoin de contenu web, Danubia le récupère et le nettoie pour le RAG, l'agrégation et les jeux de données.

Alimentez votre pipeline RAG

Envoyez une URL et recevez du markdown propre, débarrassé des pubs, de la navigation et des contenus répétitifs — exactement ce dont vos embeddings et agents ont besoin.

Agrégez du contenu de partout

Rassemblez des articles propres depuis des dizaines de sources dans un seul flux, sans écrire de scraper par site.

Créez des jeux de données

Envoyez un lot d'URL et recevez un jeu de données complet de texte propre, sans construire ni gérer votre propre infrastructure de crawl.

Comment ça marche

De l'URL au texte propre en trois étapes

Vous envoyez des URL. Nous nous chargeons de l'extraction.

  1. 01

    Envoyez une URL

    Appelez l'API avec une URL, ou placez-en des milliers dans la file de traitement par batches.

  2. 02

    Nous l'extrayons

    Un worker récupère la page, suit les redirections et extrait le contenu principal.

  3. 03

    Recevez du texte propre

    Vous obtenez du markdown et des métadonnées structurées dans une seule réponse.

FAQ

Questions, réponses

La version courte. Besoin de plus de détails ? Écrivez-nous à [email protected].

Danubia est-elle gratuite pendant la bêta publique ?
Danubia est actuellement en bêta publique gratuite. Toute personne qui s'inscrit reçoit des crédits pour essayer notre API et évaluer la qualité de notre extraction.
Respectez-vous robots.txt ?
Oui. Chaque extraction est vérifiée contre robots.txt, y compris les cibles de redirection, et les délais de crawl sont honorés par hôte. Nous ne contournons jamais les blocages.
Que reçois-je en retour ?
Une réponse JSON avec le contenu principal de la page en markdown, plus des métadonnées structurées (titre, description, langue) et des métadonnées de récupération comme l'URL finale et le temps de réponse.
Rendez-vous le JavaScript ?
Oui. Lorsque vous appelez notre API, vous pouvez choisir d'utiliser un vrai navigateur. Le rendu avec un navigateur coûte plus de crédits.
Comment fonctionne la tarification par batches ?
Les tâches par batches utilisent les mêmes crédits prépayés que les requêtes à la demande, à moitié prix : une extraction fraîche coûte 0,5 crédit en mode lot, un accès au cache 0,5 crédit, et les échecs sont gratuits. Vos crédits sont partagés entre les deux.
Mes données servent-elles à entraîner des modèles ?
Jamais. Le contenu que vous extrayez via Danubia n'est stocké que pour servir vos requêtes et n'est jamais utilisé pour l'entraînement ni partagé avec des tiers.
Quelles sont les limites de débit ?
Chaque compte fonctionne sur un pool partagé de crédits prépayés. Les limites de débit protègent le service et évoluent avec votre compte ; un solde nul bloque tout nouveau travail jusqu'à la recharge.
Où mes données sont-elles stockées ?
Dans l'Union européenne. Danubia est conçu et hébergé dans l'UE. L'extraction, le stockage et les sauvegardes s'exécutent sur des serveurs européens. Nous sommes prêts pour le RGPD (une convention de traitement des données est disponible sur demande), et le contenu que vous extrayez n'est jamais utilisé pour entraîner des modèles ni partagé avec des tiers.
Qu'est-ce qu'une API d'extraction de contenu ?
C'est une API qui renvoie le contenu principal d'une page plutôt que le document entier. Vous envoyez une URL et recevez le texte de l'article en markdown propre, sans navigation, publicités, bandeaux de cookies ni restes de scripts. C'est exactement ce qu'attend un pipeline de recherche ou un modèle de langage.
Danubia est-elle une API de crawling ?
Danubia récupère les URL que vous lui donnez, une par une ou par lots de plusieurs milliers, et ne suit pas encore les liens toute seule. Le crawl à partir d'une URL de départ figure au programme. Pour transformer une liste d'URL en texte propre dès aujourd'hui, l'API batch est la bonne voie.

Commencez à extraire dès aujourd'hui.

Obtenez votre clé API, envoyez votre première URL et recevez du texte propre en retour.

Les nouveaux comptes reçoivent 500 crédits offerts.

Conçu & hébergé dans l'UE · prêt pour le RGPD · aucun entraînement sur vos données

© 2026 Danubia. Tous droits réservés.

Conçu & hébergé dans l'UE

Conçu avec daisyUI