KHỐI NGHIÊN CỨU & PHÁT TRIỂN THUẬT TOÁN GSM
TUYỂN DỤNG: RESEARCHER / SENIOR ENGINEER – REINFORCEMENT LEARNING (RL)
MỤC TIÊU CÔNG VIỆC
Vị trí Researcher/Senior Engineer chuyên về Reinforcement Learning (RL) chịu trách nhiệm nghiên cứu, thiết kế, huấn luyện và triển khai các mô hình RL vào lõi hệ thống vận hành GSM. Mục tiêu trọng tâm là ứng dụng RL để giải quyết triệt để các bài toán ra quyết định động phức tạp trong ride-hailing (phân cuốc xe, gợi ý di chuyển tài xế, định giá linh hoạt...).
Vị trí này đòi hỏi khả năng làm việc tốt trên cả hai bài toán: bài toán quy mô lớn có dữ liệu dồi dào (Big Data) lẫn bài toán dữ liệu mỏng/mới ra mắt (Data Scarcity) thông qua các kỹ thuật Offline RL, Offline-to-Online RL hoặc Transfer Learning.
I. TRÁCH NHIỆM CHÍNH
1.1/Nghiên cứu & Thiết kế Thuật toán (Core RL Modeling)
-
Mô hình hóa các bài toán kinh doanh thực tế thành bài toán ra quyết định theo chuỗi (MDP / POMDP / Multi-Agent Systems).
-
Thiết kế không gian Trạng thái (State), Hành động (Action) và Hàm thưởng (Reward Function) cân bằng giữa mục tiêu ngắn hạn (GMV, trải nghiệm khách) và mục tiêu dài hạn (hiệu suất thị trường).
-
Xây dựng và triển khai các thuật toán RL tiên tiến:
-
Cho bài toán nhiều dữ liệu:
Model-based / Model-free RL, Multi-Agent RL (MARL), Actor-Critic (PPO, SAC, DDPG), Q-Learning ở quy mô lớn.
-
Cho bài toán ít dữ liệu / cold-start:
Offline RL (CQL, IQL, TD3+BC), Contextual Bandits, Transfer Learning hoặc Meta-RL nhằm tận dụng dữ liệu lịch sử/mô phỏng mà không làm ảnh hưởng thị trường thực tế.
1.2/Triển khai Mô hình & Tối ưu hóa Thực địa (RL System & Deployment)
-
Xây dựng môi trường mô phỏng (Simulation Environment / Digital Twin) sát với thực tế thị trường để đánh giá và bench-mark mô hình trước khi rollout.
-
Đóng gói mô hình thành các microservices đạt chuẩn production (latency thấp, đáp ứng near real-time inference).
-
Phối hợp với đội ngũ Data Engineering / MLOps để thiết lập pipeline thu thập dữ liệu phản hồi (Feedback Loop) và liên tục huấn luyện mô hình (Continuous Learning).
-
Thiết kế và chạy thử nghiệm Switchback Test để chứng minh hiệu quả kinh doanh thực chất.
1.3/Hợp tác & Đồng hành cùng Đội ngũ Product / Engineering
-
Phối hợp chặt chẽ với Tech Leads, Data Scientists và PM/BA để chuyển hóa (Formulate) các vấn đề của vận hành thành bài toán RL có tính khả thi cao.
-
Nghiên cứu, cập nhật các bài báo khoa học hàng đầu từ các hãng công nghệ lớn và chuyển giao thành giải pháp cho GSM.
II. YÊU CẦU CÔNG VIỆC
2.1/Trình độ & Kinh nghiệm
-
Tốt nghiệp Đại học trở lên ngành Khoa học máy tính, Toán tin, Trí tuệ nhân tạo, Khoa học dữ liệu hoặc các ngành liên quan (ưu tiên MSc/PhD).
-
Tối thiểu 2 - 4 năm kinh nghiệm làm việc thực tế hoặc nghiên cứu chuyên sâu về Học tăng cường (Reinforcement Learning).
-
Đã từng huấn luyện và đưa ít nhất một mô hình RL / Deep Learning lên hệ thống thực tế (Production) hoặc có bài báo công bố tại các hội nghị uy tín là điểm cộng lớn.
2.2/Kỹ năng Chuyên môn & Tech Stack
-
RL Frameworks & Algorithmic Stack:
Thành thạo PyTorch / TensorFlow; kinh nghiệm dùng các thư viện RL như Ray/RLlib, Stable-Baselines3, CleanRL, D3RLpy (Offline RL) etc.
-
Language & MLOps:
Thành thạo Python (NumPy, Pandas, SciPy); có kinh nghiệm làm việc với C++ / Go là lợi thế để tối ưu latency.
-
Large-scale Data Processing:
Nice to have skills về SQL, Spark / PySpark để xử lý dữ liệu lớn giao thông/chuyến đi.
-
Serving & Infrastructure:
Nice to have skills về FastAPI/gRPC, Docker, Kubernetes, Triton Inference Server; quen thuộc với Redis, Kafka (Real-time Streaming Data).
-
Tư duy Mô hình hóa:
Hiểu rõ cách xử lý bài toán Offline RL (tránh OOD actions) và kiểm soát sự mất ổn định khi training RL.
2.3/Kỹ năng Mềm & Tư duy
-
Tư duy logic, phản biện dựa trên dữ liệu (Data-driven mindset).
-
Chủ động, tò mò về công nghệ mới và có khả năng tự nghiên cứu paper kỹ thuật.
-
Kỹ năng làm việc nhóm tốt, có khả năng giải thích ý tưởng RL phức tạp một cách đơn giản, ngắn gọn cho đồng nghiệp và quản lý cấp trên (với background thiên về Toán/KHMT).
-
Tiếng Anh tốt để đọc viết tài liệu chuyên ngành.
-
Có khả năng viết technical report theo chuẩn academic, ưu tiên biết Latex, để formulate bài toán chặt chẽ, trình bày phương pháp khoa học rõ ràng, dễ hiểu.
2.4/Điểm cộng lớn
-
Có kinh nghiệm phát triển hoặc triển khai giải pháp RL cho các bài toán tương tự trong ride hailing như tối ưu giá, định tuyến, gợi ý di chuyển, ghép xe etc.
-
Có kinh nghiệm nghiên cứu khoa học, có xuất bản quốc tế uy tín, hoặc các thành tích liên quan.