Arrow/fr
Apache Arrow est une plateforme de développement multilingue pour la gestion des données en mémoire. Elle utilise un format standardisé en colonnes qui organise les données hiérarchiques ou autres afin de permettre des opérations analytiques efficaces. La plateforme offre des bibliothèques de calcul, la transmission sans copie et en continu des données et la communication interprocessus. Parmi les langages pris en charge, on compte C, C++, C#, Go, Java, JavaScript, MATLAB, Python, R, Ruby et Rust.
CUDA¶
Arrow est aussi disponible avec CUDA.
où X.Y.Z désigne la version.
Interfaces Python¶
Le module contient des interfaces pour plusieurs versions de Python. Pour connaître les versions compatibles, lancez
où X.Y.Z désigne la version.
Ou cherchez pyarrow directement avec
PyArrow¶
Les interfaces Python (appelées PyArrow) s’intègrent avec les objets de première classe NumPy, Pandas, et les objets natifs Python. Elles sont basées sur l'implémentation C++ de Arrow.
-
Chargez les modules requis.
où X.Y.Z désigne la version.
-
Importez PyArrow.
L’importation est réussie si rien n’est affiché.
Pour plus d'information, consultez la documentation Python.
Autres paquets Python dépendants¶
L'installation de certains paquets Python dépend de PyArrow.
Une fois le module arrow chargé, la dépendance à pyarrow sera satisfaite.
Si pip list affiche une entrée, alors pyarrow est disponible et visible par pip. S'il n'y a pas d'entrée, pyarrow n'est pas disponible.
Format Apache Parquet¶
Le format de fichier Parquet est disponible.
Pour importer le module Parquet, effectuez les étapes pour pyarrow ci-dessus et lancez ensuite
L’importation est réussie si rien n’est affiché.
Interfaces R¶
Arrow possède une interface avec la bibliothèque Arrow C++ pour permettre l'accès en R à plusieurs de ses fonctionnalités. Ceci inclut l’analyse de grands ensembles de données multifichiers (open_dataset()); la capacité de travailler avec des fichiers individuels de format Parquet (read_parquet(), write_parquet()) et Feather (read_feather(), write_feather()); l'accès à la mémoire et aux messages Arrow.
Installation¶
-
Chargez les modules requis.
-
Spécifiez le répertoire d’installation local.
-
Exportez les variables requises pour vous assurer d’utiliser l'installation du système.
-
Installez les interfaces.
Utilisation¶
Une fois les interfaces installées, il faut les charger.
-
Chargez les modules requis.
-
Chargez la bibliothèque.
Pour plus d'information, consultez la documentation Arrow sur R.
Dépannage¶
Ceci est une erreur normale générée par cette roue factice.¶
Voir la page Dummy wheel.
Erreur : ModuleNotFoundError: No module named 'pyarrow'¶
Une erreur peut survenir à l'importation de pyarrow.
Traceback (most recent call last):
File "<string>", line 1, in <module>
ModuleNotFoundError: No module named 'pyarrow'
Ceci se produit habituellement dans l'un ou l'autre cas suivant :
Module Arrow non chargé¶
Chargez un module arrow compatible (voir PyArrow).
Module Python non chargé¶
Quand un module Python n'est pas chargé et qu'un environnement virtuel est activé, les interfaces Python ne sont pas disponibles et donc pyarrow n'est pas visible.
Solution
-
Désactivez l'environnement virtuel Python.
Remarque
Si un environnement virtuel est actif, il est important de le désactiver avant de charger le module. Une fois le module chargé, activez à nouveau l'environnement virtuel.
-
Chargez le module.
-
Vérifiez que le module est visible par
pip.et que le module Python que vous avez chargé lui a accès.
Si aucune erreur ne survient, tout va bien.