4 points par dlwogjs311 7 시간 전 | 1 commentaires | Partager sur WhatsApp

C’est un service d’offres d’emploi et d’informations sur les entreprises que je développe seul comme side project.

Quand on consulte une offre, ce qu’on veut vraiment savoir, c’est : « Combien cette entreprise a-t-elle d’employés, quel est son salaire moyen, et qu’en est-il de sa situation financière ? » Or, ces informations n’apparaissent pas dans l’annonce. Je construis donc ce service avec pour objectif d’associer automatiquement des données concrètes sur l’entreprise à chaque offre, afin de tout afficher sur un seul écran.

Aperçu

  • Agrégation des offres de 8 canaux : Wanted, Saramin, JobKorea, Jumpit, Rallit, Programmers, Careerly et Remember (avec une forte proportion de postes de développement)
  • Affichage pour chaque offre de l’effectif de l’entreprise, du salaire moyen, des données financières, des certifications gouvernementales, de la stack technique et des catégories de poste
  • Séries temporelles des tendances de recrutement par stack, catégorie de poste et taille d’entreprise
  • Consultation sans connexion

Mises à jour récentes

  • Forte extension de la couverture sur l’effectif et le salaire moyen : les données publiques du régime national de retraite sont rattachées après normalisation des noms d’entreprise, avec un appui API en complément. De nombreuses entreprises auparavant non reconnues à cause des variations de raison sociale (, 주식회사, nom de service entre parenthèses) ont pu être récupérées grâce à la normalisation et à l’appariement sur le nom principal.
  • Structuration du contenu des offres : les annonces, hétérogènes selon les sources (texte brut ou image), sont normalisées par un LLM en 5 sections : poste, qualifications, éléments appréciés et avantages. Les annonces sous forme d’image sont d’abord converties en texte par OCR, puis structurées.
  • Suppression des doublons entre plateformes : lorsqu’un même poste est publié sur plusieurs plateformes, il est regroupé par entreprise et par titre puis fusionné en une seule annonce représentative (y compris les alias anglais ↔ coréen des noms d’entreprise).
  • Filtre des entreprises certifiées par l’État : association des entreprises Venture, Inno-Biz, Main-Biz et de celles menant des projets publics de R&D, avec badge et filtre dédiés.
  • Indicateurs financiers : ratio de fonds propres, ROE, ratio d’endettement, ainsi que graphiques de performance annuelle et d’évolution des entrées/sorties de salariés.
  • Fraîcheur des données : prise en compte des nouvelles offres toutes les 2 heures, désactivation automatique des offres clôturées. Un contrôle de cohérence détectant automatiquement les régressions de données (forte baisse de couverture, échec de déduplication) a aussi été ajouté.

Sources de données
Les offres proviennent de chaque canal, et les informations d’entreprise combinent le régime national de retraite (effectif, salaires), DART (finances) et les données publiques de certifications gouvernementales (API odcloud). Les cycles de mise à jour étant différents (offres = quotidien / 2 heures, retraite = mensuel, DART = annuel), la collecte suit pour chacun un rythme distinct.

Comme je développe cela seul, il y a encore beaucoup de points à améliorer. N’hésitez pas à l’essayer et à me faire part de vos retours ; je les prendrai en compte (en bas du site, « Issues et demandes » → cela crée une issue GitHub).

1 commentaires

 
baeba 6 시간 전

Oh.. merci. C'est vraiment gentil.. Ça aidera beaucoup de monde. Merci pour votre travail.