科研人员用超算,门槛高、上手难
命令行门槛高
需要掌握大量Linux指令、调度脚本,不熟悉命令操作很难上手集群。
作业脚本编写难
不会编写、修改Slurm提交脚本,参数配置错误导致任务频繁提交失败。
资源选型无概念
不清楚计算节点、CPU/GPU、内存时长该如何配置,经常出现资源浪费或资源不足。
任务故障难排查
作业报错看不懂日志,不知道任务失败原因,排错耗费大量科研时间。
集群状态不透明
无法快速了解队列、节点负载、个人配额情况,任务排队久却不知道问题在哪。
环境配置繁琐复杂
软件依赖、编译环境搭建难度大,环境冲突,大量精力消耗在底层环境而非科研本身。