Intermediate Data Engineer

Remote, Brazil·Posted 21d ago
pythonawsspark
<p>&nbsp;</p> <p><strong>What You Do</strong></p> <ul> <li>Support the development and maintenance of data pipelines, ingestion processes, and data transformations.</li> <li>Create and maintain SQL queries, Python scripts, and Spark-based workloads used for data processing and analytics.</li> <li>Assist in troubleshooting pipeline failures, data quality issues, and operational incidents.</li> <li>Work with senior engineers to implement schema mappings, transformation logic, and data validation rules.</li> <li>Ensure datasets meet expected schemas, data contracts, and quality standards.</li> <li>Support metadata management, dataset documentation, and lineage activities.</li> <li>Assist in maintaining data classification information according to company standards.</li> <li>Help automate repetitive operational and data management tasks to improve efficiency and reliability.</li> <li>Contribute to monitoring, alerting, and operational support for data pipelines and workflows.</li> <li>Participate in testing activities, including unit tests, transformation validation, and data quality checks.</li> <li>Follow established engineering standards, coding practices, and team development patterns.</li> <li>Learn and apply security, privacy, and compliance requirements when handling sensitive or regulated data.</li> <li>Collaborate with Data Governance, Security, and Compliance teams when required.</li> <li>Contribute to continuous improvement initiatives focused on data trust, reliability, and operational excellence.</li> </ul> <p><span data-teams="true"><br><strong>Requirements and Qualifications</strong><br></span></p> <ul> <li>Bachelor's degree in Computer Science, Computer Engineering, Information Systems, Data Science, Software Engineering, or related fields.</li> <li>Basic to intermediate English.</li> <li>Up to 2 years of experience in Data Engineering, Software Engineering, Data Analytics, or related areas.</li> <li>Knowledge of SQL and Python.</li> <li>Understanding of ETL/ELT concepts and data transformation processes.</li> <li>Familiarity with relational databases and data warehousing concepts.</li> <li>Basic knowledge of Spark, Databricks, or distributed data processing frameworks.</li> <li>Familiarity with Git and version control workflows.</li> <li>Basic understanding of cloud platforms such as AWS, Azure, or Google Cloud.</li> <li>Knowledge of automation concepts and scripting for operational efficiency.</li> <li>Basic understanding of data quality concepts and validation practices.</li> <li>Familiarity with data governance principles, including metadata, ownership, stewardship, and documentation.</li> <li>Basic knowledge of data classification concepts (Public, Internal, Confidential, Restricted).</li> <li>Understanding of data lineage and traceability concepts.</li> <li>Awareness of security best practices, including access management, secrets management, and least-privilege principles.</li> <li>Strong analytical, problem-solving, and communication skills.</li> <li>Willingness to learn new technologies and collaborate across teams.</li> </ul> <p><span data-teams="true"><br><strong>Security, Compliance &amp; Governance</strong><br></span></p> <ul> <li>Follow company standards for handling sensitive and regulated data.</li> <li>Apply data classification requirements when creating or maintaining datasets and pipelines.</li> <li>Use approved authentication, authorization, and secrets management mechanisms.</li> <li>Avoid exposing sensitive information through logs, exports, testing data, or documentation.</li> <li>Support auditability by maintaining documentation, metadata, and lineage information.</li> <li>Escalate security, privacy, or compliance concerns when requirements are unclear.</li> <li>Follow established governance processes and contribute to improving data trust across the organization.</li> </ul> <p><span data-teams="true"><br><strong>How You Work</strong><br></span></p> <ul> <li>Demonstrate curiosity and a continuous learning mindset.</li> <li>Write clean, readable, and maintainable code.</li> <li>Follow coding standards, testing practices, and development workflows.</li> <li>Communicate progress, blockers, and technical questions clearly.</li> <li>Participate in code reviews and knowledge-sharing activities.</li> <li>Take ownership of assigned tasks while escalating risks or uncertainties appropriately.</li> <li>Contribute positively to team collaboration and a culture of continuous improvement.</li> </ul> <p><span data-teams="true"><br><strong>Nice to Have</strong><br></span></p> <ul> <li>Experience with Databricks, dbt, or similar technologies.</li> <li>Familiarity with CI/CD tools such as GitHub Actions, Azure DevOps</li> <li>Familiarity with APIs, JSON, event-driven architectures, or messaging systems.</li> <li>Exposure to vulnerability scanning, secret scanning, or secure development practices.</li> <li>Understanding of privacy regulations such as LGPD, GDPR, or similar frameworks.</li> </ul>