Data preparation on Dataleon platform

March 25, 2021
Blog Image

Machine learning is an application of artificial intelligence (AI), that provides system with an ability to automatically learn and improve from experience without being explicitly programmed. ML focuses on the development of computer programs that can access data and use them to learn for themselves. One of the most crucial aspects ML depends on is data.

On Dataleon we realize that data preparation is a very important step in the machine learning process. Basically, it includes a set of procedures of getting ready the data for training, testing and implementation of an algorithm. This multi-step process involves data collecting, cleaning, validation, transformation and labeling.

The process of data preparation starts with searching for the right data. It involves collecting the data that is believed to be useful in making a prediction and clearly defining the form the prediction will take. It may also embrace talking to project managers and other people with deep expertise in the domain. Deep understanding of our customer`s needs detemine the data we will later use for ML.

When gathering the data, the main problems we face are lack of data, poor quality data and unbalanced data. To solve these problems, Dataleon`s experts use Scenes Editor. It is an interface which is used for data generation. The output data can be later used for labeling.

Data cleaning is the next step in data preparation. On this step we remove all the data that do not belong to the dataset. This process involves fixing or removing incorrect, corrupted, incorrectly formated, duplicate, or incomplete data withing a dataset.

Data validation takes place after cleaning the data. On this step we check the data for:

  • Validity. The degree to which the data conforms to defined
    business rules or constraints.
  • Accuracy. Ensure that your data is close to the true values.
  • Completeness. The degree to which all required data is
    known.
  • Consistency. Ensure that your data is consistent within the same
    dataset and/or across multiple data sets.
  • Uniformity. The degree to which the data is specified using
    the same unit of measure.

Being on the data transformation stage, we convert data from one format or structure into another one. Transformation process can also be referred to as data wrangling, or data mungling, transforming and mapping data from one “raw” data form into another format for warehousing and analyzing.

The final stage of the data preparation process is data labeling. In machine learning it is the process of identifying raw data (images, text files, videos, etc.) and adding one or more meaningful and informative labels to provide context so that a machine learning model can learn from it. Dataleon`s experts use Labeling Editor for data labeling.

Dataleon API can guide you trough the whole process of data preparation. If you are interested in our services, just let us know.

Auteur

Autres blogs connexes

Questions fréquemment posées

Dataleon propose-t-il une assistance ?
Oui. Chaque client bénéficie d'un accompagnement dédié : support technique par e-mail et visioconférence, documentation complète et exemples de code pour intégrer nos API. Nos ingénieurs vous aident à cadrer vos parcours KYC et KYB, à réaliser l'intégration puis à passer en production sans interruption de service. Un interlocuteur unique reste ensuite disponible pour suivre vos volumes, ajuster vos règles de contrôle et répondre à vos questions métier comme techniques.
Mes fichiers sont-ils supprimés après traitement ?
Oui. Vos documents sont chiffrés en transit comme au repos, traités puis supprimés automatiquement à l'issue de la durée de conservation que vous définissez. Vous restez seul propriétaire des données transmises : elles ne sont ni revendues ni utilisées à d'autres fins que la réalisation de vos contrôles. Vous pouvez aussi déclencher la suppression immédiate d'un dossier depuis l'interface ou via l'API, et ne conserver que les résultats d'analyse nécessaires à vos obligations de conformité.
Peut-on intégrer Dataleon à nos outils via API ?
Oui. Dataleon se connecte à votre système d'information via une API REST documentée, des webhooks temps réel et des connecteurs vers vos outils existants : CRM, core banking, GED ou solutions de signature électronique. Les parcours de vérification, les règles de scoring, les seuils de risque et les workflows de validation sont entièrement paramétrables afin de coller à vos procédures internes. Nos équipes peuvent également développer des traitements sur mesure lorsque votre cas d'usage l'exige.
Puis-je tester Dataleon avant de m'engager ?
Oui. Vous bénéficiez d'un essai gratuit de 15 jours, sans engagement, pour vérifier vos propres pièces d'identité, justificatifs et documents d'entreprise et mesurer la qualité de l'extraction et des contrôles KYC/KYB. Pendant ces 15 jours, vous accédez à l'interface ainsi qu'à des clés d'API de test afin de valider votre intégration technique de bout en bout. Nous proposons également une démonstration personnalisée avec un expert pour construire ensemble le parcours adapté à votre activité.
Êtes-vous conforme au RGPD avec des serveurs en France ?
Oui. Dataleon est conforme au RGPD et l'ensemble des traitements ainsi que le stockage des données sont réalisés en France, sur l'infrastructure de Scaleway, hébergeur souverain français. Nous appliquons le chiffrement des données en transit et au repos, la minimisation des informations collectées, une gestion fine des droits d'accès et une traçabilité complète des opérations. Un accord de traitement des données (DPA) et notre documentation de sécurité vous sont fournis pour faciliter vos audits internes et réglementaires.

L'automatisation qui rend la conformité invisible.

Dataleon, le chaînon manquant entre votre conformité et votre croissance. KYC, KYB, LCB-FT, enfin réunis au même endroit.