英文原标题:Run Positron on Amazon SageMaker AI for data science workflows
本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗
- Positron 是 Posit 面向数据科学的集成开发环境,现可在 Amazon SageMaker AI 上运行,让数据科学家在同一浏览器环境中完成数据访问、R 与 Python 开发、部署、应用开发和报告。
- 在 SageMaker AI 上运行 Positron 时,IDE 以 Space 执行角色运行,可直接查询 Amazon Athena、AWS Glue Data Catalog 和 Amazon S3,无需存储或轮换凭证。
- Posit Assistant 可使用 Amazon Bedrock 作为模型提供方,AI 辅助在用户自己的 AWS 账户和区域中运行,无需单独的模型提供方 API 密钥。
- Posit 发布了基于 Amazon SageMaker Distribution 镜像的 Positron 容器镜像定义,管理员构建并推送到自己的 Amazon ECR,注册到 SageMaker AI 并附加到 Studio 域,数据科学家创建 Space 时选择 Positron 即可。
- 文章以合成 5 万笔贷款组合为例,演示从 Athena 查询、R 特征验证、Python 训练 XGBoost、SageMaker AI 实时端点部署、Shiny for Python 应用到 Quarto 报告的可复现工作流。
关键数据
- 合成贷款组合共 50,000 笔,其中 1,500 条记录收入缺失,1,015 笔违约,整体违约率 2.03%。
- Athena 查询返回 5 行样本、6 个字段,扫描 2.18 MiB,耗时不到一秒。
- 排除 1,500 条不完整记录后,剩余 48,500 笔贷款用于建模和评分。
- XGBoost 分类器在 40,000 行、3 个模型特征的矩阵上训练,留出评估 AUC 为 0.834,最高风险十分位的观测违约率为 12.3%。
- 记录的会话信息显示 6,657,942 tokens,其中缓存读取 6,118,411、缓存写入 462,905,估计成本 6.319 美元,缓存效率 92.5%。
- 演示环境需要 ml.t3.xlarge 或更大实例。
为什么值得看:该文展示了如何在 Amazon SageMaker AI 上以托管方式运行 Positron,把受治理的数据访问、R/Python 开发、模型部署、应用和报告整合到一个基于角色的可复现工作流中。