Auditeur de tâches SWE-Bench
70 $US à 90 $US/hFourchette indicative communiquée par Mercor
Publié le 28 août 2026 · Candidatures jusqu'au 18 octobre 2026
Je vous redirige vers la page officielle de Mercor. La candidature est gratuite et se fait en anglais.
Je touche une commission de la plateforme si un candidat que j'ai orienté est recruté. Cela ne change rien pour vous.
Ce poste à distance consiste à évaluer et à auditer des tâches de référence en génie logiciel, des correctifs de référence et des suites de tests pour des modèles d'IA. Les candidats ont besoin d'au moins trois ans d'expérience professionnelle en génie logiciel, d'un historique de contributions open-source et de solides compétences en révision de code.
Description en anglais, telle que publiée par Mercor.
Evaluate the quality, correctness, and reproducibility of software-engineering benchmark tasks used to train and evaluate a frontier AI lab's models. You'll assess repository-level tasks, reference patches, test harnesses, and grading integrity, and provide clear, rubric-based written feedback.
Basic Qualifications • 3+ years professional software engineering • Real open-source contribution or maintainer experience (merged PRs, committer / maintainer roles) • Strong ability to audit reference patches, test runners, and Docker isolation, and to detect answer leakage / reward hacking • Fluency across common ecosystems (Python and at least one of Java / Go / TypeScript / C++)
Preferred Qualifications • Familiarity with SWE-Bench (Verified) or similar repository benchmarks • Maintainer history on major Python OSS (Django, Flask, scikit-learn, sympy, pytest, etc.) • Prior code-review or task-grading experience
3 postes
À propos de Mercor
Mercor est une place de marché américaine qui recrute des experts à distance pour des projets d'IA et de conseil, du droit à l'ingénierie. L'offre originale est consultable sur leur site.
Voir l'offre sur MercorAutres postes en Développement logiciel
Responsable d'ingénierie Python, entraînement et évaluation de LLM
Ce poste indépendant à distance consiste à diriger de grandes équipes d'ingénieurs Python et de data scientists pour soutenir l'entraînement et l'évaluation des LLM fondamentaux. Les candidats doivent justifier d'au moins cinq ans d'expérience en génie logiciel, d'une solide maîtrise de Python et de compétences avérées en gestion.
- Python
- Software Development
Publié hier
Expert sectoriel - Ingenierie
Ce role distant consiste a batir des fonctionnalites front-end evolutives avec React et JavaScript. Les candidats ont besoin d'au moins trois annees d'experience en tant qu'ingenieur front-end et d'un diplome en informatique ou equivalent.
- Data Engineering
Publié il y a 2 j
Contributeur open source (GitHub)
Le contributeur open source explore, débogue et modifie des composants front-end et back-end pour un projet d'entraînement en IA. Les candidats ont besoin d'un profil GitHub vérifiable avec des contributions open source significatives et d'une solide expérience en génie logiciel dans plusieurs langages de programmation.
- Python3
- JAVA
- Rust
- +3
Publié il y a 3 j100 $US à 150 $US/h
Ingénieur logiciel full stack senior
L'ingénieur logiciel full stack senior conçoit, débugue et évalue des composants d'application front end et back end pour un projet de formation en IA. Le poste requiert une solide expérience professionnelle dans le développement d'applications full stack destinées à la production ainsi qu'une expertise pratique sur plusieurs langages de programmation.
- Python
- React
- JavaScript
- +5
Publié il y a 3 j50 $US à 100 $US/h