Sobes.tech

Data Analyst

Qu'est-ce que la valeur p et comment l'utiliser pour tirer des conclusions lors de l'analyse d'un test A/B (rejeter ou ne pas rejeter l'hypothèse nulle) ?

358

Expliquez par des mots l'algorithme de calcul du produit scalaire de deux vecteurs compressés (codés en RLE) en une seule passe sans leur décompression. Quelle est la complexité asymptotique en temps?

318

L'apprentissage automatique a-t-il été utilisé pour la sélection de caractéristiques dans la tâche de classification des voitures?

297

Parle-moi de tes projets les plus intéressants et pourquoi tu veux évoluer dans l'analyse.

267

D. Valera et les distributeurs automatiques Dans un centre d'affaires, il y a 10 distributeurs automatiques extérieurement identiques avec des chocolats. Chaque distributeur donne un chocolat avec sa propre probabilité fixe, qui est initialement inconnue et peut varier entre les machines. Valera veut obtenir autant de chocolats que possible, mais son budget est limité à 200 tugrik. Chaque tentative d'achat (utilisation de n'importe quel distributeur une fois) coûte exactement 1 tugrik — le paiement est effectué indépendamment du fait que le distributeur donne ou non un chocolat. Valera, essayant d'apprendre les probabilités des machines, a rencontré le garde de sécurité Alexei, qui lui a partagé une information importante. Le garde lui a dit que 2/5 des machines ont des probabilités tirées d'une distribution uniforme sur [0.2, 0.3], 2/5 de [0.4, 0.5], et le reste de [0.85, 1]. Votre tâche est de concevoir un algorithme qui aide Valera à obtenir autant de chocolats que possible. Protocole d'interaction Ceci est une tâche interactive. Votre programme doit d'abord afficher le numéro de la machine — un nombre de 0 à 9. Ensuite, le système (interacteur) renverra le résultat : 1 si un chocolat a été distribué, ou 0 si non. Votre programme peut lire cette valeur (par exemple via input()) pour l'utiliser dans des calculs ultérieurs. Système de scoring Dans chaque test, le pourcentage de tentatives réussies pour obtenir des chocolats sera évalué. Si ce pourcentage dépasse 75%, le test est considéré comme réussi. Note Il est recommandé d'utiliser Python 3.8 (Handbook DS) comme compilateur.

152

La solution proposée fonctionnerait-elle pour SQLite?

150

Il était une fois, un stagiaire antifraude de Yandex Ads a rejoint l'équipe. Pendant que le groupe de fraude opérait, simulant du trafic sur leurs sites via des visites de bots, et recevant ainsi de l'argent pour les impressions publicitaires par des bots, la tâche du stagiaire était de trouver tous ces sites frauduleux avec du trafic faux. Fait intéressant, tout le trafic sur ces sites était généré avec substitution d'IP, donnant l'impression qu'un bot visitait depuis la ville A, mais en réalité, l'appareil était dans un endroit complètement différent. Beaucoup de temps a passé, et le stagiaire a essayé de couvrir tout ce groupe de fraude, réussissant même à attraper certains sites par parties. Mais tout le réseau n'a pas pu être attrapé. Après un certain temps, il a remarqué une nouvelle: dans la ville A, le 02.08.2025, il n'y avait pas du tout d'internet mobile. Cependant, l'internet câblé (domicile) continuait de fonctionner. Étant donné cela, comment le stagiaire peut-il trouver tous les sites faux? Vous avez des logs de sites au format tableau pour la période du 30.07.2025 au 10.08.2025: timestamp | site_id | city_id Chaque enregistrement correspond à une visite d'un site par un appareil. Il est connu que le trafic de bots change beaucoup moins que le trafic réel par jour. Votre tâche est de trouver tous les sites dont le trafic était principalement composé de bots qui ont falsifié leur région pour la ville A. Note La table contenant les données s'appelle logs. Exemple d'un enregistrement de table: timestamp | site_id | city_id [phone]:13:53 | 6e84d9b71ca44aea | A

148

Quelle est la complexité asymptotique de la solution proposée en termes de temps et de mémoire?

148

Pourquoi la standardisation du format de réponse dans le benchmark a-t-elle encore du sens, même si elle limite le modèle?

140

Peut-on résoudre Product of Array Except Self plus simplement si l'on est autorisé à utiliser n'importe quelle opération?

137

Quelle est la complexité mémoire de la solution au problème Product of Array Except Self et quelles variables supplémentaires sont utilisées?

129

-- 1.2 Comment la réponse changera-t-elle si on change le type de JOIN en LEFT? -- 1.3 Indiquez l'ordre d'exécution des opérateurs dans cette requête. from join group by select order by limit -- 2. La table campaigns a été corrigée : suppression des doublons, ajout de la clé (PK). -- Plus de campagnes ont été menées, en raison de bugs, certains utilisateurs ont commencé à recevoir des tentatives de livraison de communications échouées, et certains n'ont pas pu être affichés du tout. -- Sur les campagnes promotionnelles envoyées aux utilisateurs : -- 2.1 Écrivez une requête qui affiche le nombre d'utilisateurs ayant reçu avec succès la communication pour chaque campagne. -- 2.2 Modifiez la requête pour afficher : le nombre d'utilisateurs n'ayant reçu aucune communication réussie, pour chaque campagne.

128

Comment comparer la réponse du modèle avec la référence (vérité terrain) dans un benchmark ? Quelle métrique utiliser ?

126

A. Le Meilleur Laboratoire Scientifique Dans une certaine ville, plusieurs laboratoires scientifiques étudient des cultures bactériennes. Ils étudient une séquence d'échantillons, où chaque échantillon appartient à une souche spécifique (type de bactéries). L'université principale de recherche biologique a annoncé un concours : trouver le nombre maximum d'échantillons consécutifs pouvant être analysés en tenant compte de la restriction. Plus précisément : dans tout segment continu de la séquence, il ne doit y avoir pas plus de K souches différentes. Notre laboratoire aspire à devenir le meilleur de la ville. Pour gagner le concours, nous devons trouver exactement une telle longueur maximale de segment qui satisfait la condition stricte. Nous comptons sur vous, car en cas de victoire, le laboratoire recevra une subvention qui ouvrira de nouveaux horizons pour nos recherches. Format d'entrée La première ligne contient deux nombres : N — la longueur de la séquence d'échantillons et K — la restriction sur le nombre de souches différentes. La deuxième ligne contient N nombres — les éléments de la séquence. Format de sortie Le programme doit afficher le nombre de la longueur maximale d'un segment de la séquence d'échantillons. Exemple 1 Entrée [phone] Sortie 3

122

Pour une liste de nombres entiers, retourner une liste de la même taille, dans laquelle à la position i se trouve le produit de tous les éléments de la liste, sauf l'élément à la position i de la liste d'origine Exemples : [2, 3, 4] -> [3*4, 2*4, 2*3] -> [12, 8, 6] def product_except_self(nums: list[int]) -> list[int]: # votre code ici

121

Pouvez-vous raconter quelle pile technologique et quels outils vous avez utilisés et maîtrisés?

120

Écrivez une fonction complète sum_series en Python et vérifiez-la avec l'exemple de la tâche.

120

Dans quelle mesure êtes-vous intéressé par l'apprentissage automatique et aimeriez-vous l'utiliser dans votre travail comme un outil?

120

Que changera-t-il si vous remplacez COUNT(*) par COUNT() sans argument ?

117

Comment créeriez-vous un benchmark en géométrie ? Décrivez la chaîne depuis l'idée jusqu'au jeu de données final.

117
/3