Conversation
…lify normalization across pipelines - Removed `zscore` and `rescale` normalization options to avoid memory overhead and incompatibilities with pretrained models, defaulting all to Min-Max [0,1]. - Modified ingestion, validation, and inference pipelines to batch-process datasets, eliminating float32 materialization to reduce RAM usage. - Adjusted safe dataset caps and shuffle buffer sizes for better memory scaling on large datasets. - Added actionable error messages for OOM errors, recommending batch size or resolution adjustments. - Improved `.wslconfig` and memory env defaults to optimize WSL2 VM memory allocation for training on 16GB+ systems. - Enhanced training workflows to use lightweight cached embeddings and optimize memory efficiency during feature extraction and fine-tuning phases. - Updated frontend `NodeConfigPanel` to switch normalization to read-only "info" fields, reflecting the enforced Min-Max normalization. - Revised transparency in training reports with added warnings for high-resolution training setups and overfitting risks without augmentation.
…s isolation for training - Added Hyperparameter Optimization (HPO) pipeline using Optuna, including support for architecture-specific strategies and trial pruning. - Integrated training subprocess isolation to handle OOM errors gracefully, ensuring Kafka consumer survivability and clean job failure reporting. - Introduced memory and CPU load test benchmarking datasets for robustness testing across training phases.
…HPO support - Introduced reusable `FieldHelp` component for accessible field-specific guidance using popovers. - Added `hparams` node kind with associated icon and description to support hyperparameter optimization workflows.
…ers in nodeConfig - Introduced `help` descriptions for key fields: `epochs`, `learningRate`, `batchSize`, `batchNorm`, `earlyStopping`, and `esPatience`. - Enhanced user guidance with detailed explanations of parameter functions, recommended ranges, and training implications.
…x and Score-CAM components / new SEE logs for event - Introduced `FieldHelp` tooltips to provide detailed explanations for confusion matrix interpretation and Score-CAM visualizations. - Enhanced user guidance with clarifications on model predictions and interpretability workflows.
feat: HPO con Optuna, optimización de memoria del ML Engine y UX del lienzo (Release 3)
…ompatibility - Updated `requirements-core.txt` to lock MLflow to `>=2.21,<3` to align with server version and maintain protobuf compatibility with TensorFlow 2.15.1. - Adjusted protobuf version range to `<5` to prevent conflicts caused by MLflow 3.x dependencies.
…ompatibility - Removed version pinning for MLflow in `requirements-core.txt` to avoid unnecessary CI dependency reviews triggered by MLflow server CVEs. - Retained `protobuf<5` constraint to enforce compatibility with TensorFlow 2.15.1 and resolve MLflow 2.x versions implicitly.
…ndency review - Documented rationale for protobuf DoS vulnerability exception. - Confirmed no exposure due to internal serialization use in TensorFlow/MLflow with controlled inputs. - Scheduled review for stack migration to TensorFlow/protobuf 5+.
|
Aprobado |
|
Se ha completado satisfactoriamente el ciclo de pruebas funcionales, de regresión y de estrés sobre el Pull Request #41. Los componentes de entrenamiento de arquitecturas (Transfer Learning con backbones ImageNet), optimización crítica de memoria y las métricas de interpretabilidad visual se encuentran estables y operando bajo las métricas de rendimiento planificadas. Matriz de Verificación y Estado de Pruebas
Observaciones de QA e Incremento de Calidad PreventivaSi bien el flujo actual cumple estrictamente con las pruebas funcionales de aceptación y se aprueba su paso a producción, el equipo de QA emite la siguiente recomendación técnica para mitigar riesgos operacionales futuros: Recomendación para la Ingesta de Datasets y Prevención de Sesgo:
Dictamen Final
Estado del Pull Request: APROBADOEl incremento de código es seguro, robusto y se autoriza la fusión (Merge) de los cambios a la rama principal (main). |
Release 3 — Mejoras de ML, rendimiento y robustez
Cierra la iniciativa "Mejoras" (Sprint 3). Sobre la base ya en
main, suma HPO automático,robustez de memoria del ml-engine y mejoras de UX del lienzo.
Entrenamiento y arquitecturas
Optimización de recursos (crítico)
.wslconfig; build en 2 capas; pins reproducibles (numpy<2, TF 2.15.1, mlflow<3/protobuf<5, torch 2.3.1+cu121).Métricas, interpretabilidad y UX
Verificación
tsc -bOK · backend JUnit/Checkstyle (CI) · smokes en contenedor.docs/evidencias.md. Estrategia de optimización:docs/contexto/optimizacion_recursos_ml.md.Closes: #39 #38