[name] fragte: Stellen Sie sich vor, das Deployment besteht nur darin, Dateien auf eine entfernte Maschine zu kopieren und pnpm start auszuführen. Die Anwendung ist zu einer Hochlastlösung mit RPS bis zu 1000 geworden. Wie würden Sie CI/CD für dieses Projekt einrichten?
Frontend
[name] fragte: Hast du praktische Erfahrung mit CI?
[name] fragte: Erzählen Sie mir mehr über die Tests, die Sie geschrieben haben, und welche Arten von Tests Sie kennen, aber noch nicht in der Praxis angewendet haben.
Wie viele gleichzeitige Verbindungen kann der Dienst handhaben und wie schätzt man diese anhand von 1 Million täglich aktiven Nutzern, Spitzenlast und Verbindungsdauer?
[name] fragte: War der Architekt im Allgemeinen für die Frontend-Architektur verantwortlich, oder gab es eine separate Person, die dafür zuständig war?
[name] fragte: Hast du Erfahrung mit KI-Tools?
[name] fragte: Was kannst du über die Vor- und Nachteile der Arbeit bei Yandex sagen?
Wo und wie sollten Geheimnisse für LLM, Datenbanken und Warteschlangen gespeichert und übertragen werden, um eine Exposition im Code und in Repositories zu vermeiden?
[name] fragte: Welches dieser Projekte war das letzte?
[name] fragte: Konzentrieren Sie sich auf eine konkrete Aufgabe: Beschreiben Sie die Zeitpläne, Komplexität und die Top-3-Schlüsseltechnischen Herausforderungen, denen Sie begegnet sind.
[name] fragte: Hast du schon einmal mit SSR gearbeitet?
[name] fragte: Erzählen Sie von der größten und technisch komplexesten konkreten Aufgabe oder Funktion, mit der Sie konfrontiert wurden.
Wer sollte Aufgaben aus der Warteschlange lesen und sie an LLM senden, und wie man Chunk und Endergebnisse der Antwort zurück in die Warteschlange veröffentlicht?
Wie erscheint das Geheimnis im LLM-Gateway bei Verwendung von Kubernetes und Integration mit geheimen Speicher?
Wer sollte die Ergebnisse aus der Warteschlange lesen, Nachrichten und Chats in Datenbanken speichern und Streaming-Daten an eine offene SSE-Verbindung senden?
Wie man den generierten HTML-Code in ein sandboxed iframe liefert und die Interaktion zwischen der Elternseite und dem iframe organisiert?
Wie man die RPS-Anfragen an LLM basierend auf der Nachrichtenfrequenz der Benutzer, der Sitzungsdauer und der Anzahl der Benutzer schätzt und sie mit der Durchsatzkapazität des Modells vergleicht?
Welche Sicherheitsrisiken sind für ein solches Projekt bedeutend und welche Maßnahmen müssen ergriffen werden?
Wie man eine Warteschlange, Rate Limiting und Request-Handling für LLM organisiert, wenn die verfügbare Durchsatzkapazität des Modells überschritten wird?
Wie man einen Chat-Service mit LLM entwirft und skaliert: Zwischen SSE und WebSocket für die Client-Server-Kommunikation wählen, Streaming-Antworten des Modells organisieren und Anfragen verarbeiten?