전류분석 시뮬레이션 current IOT data simul Rstudio muti core

 IOT 데이터는 일반적으로, 초당 데이터베이스를 받는다. 하지만, 아래와 같은 케이스는 분단위로 데이터 셋을 받아도 연간 한개 포인트에 52만개의 데이터 이다. 이것과 관련 해서 7일 단위 30일 단위 평균을 구할 때, 속도의 문제가 발생 한다.

속도의 문제가 발생 할때, 우리는 어떻게 처리 해야 하며, 그리고, 데이터가 발생 할시 트렌드 분석을 해야 하는데, 트렌드는 비선형 형태로 데이터가 나타난다. 비선형 형태로 데이터가 나타 날때, 어떻게 Base line 신호를 주어야 하는 기준치를 나타낼 것인지 새로운 문제가 될것이다.

Data Frame 만들고 Filter 하고 query 하기 pandas(판다스)

Pandas는 DataFrame을 아주 쉽게 파이썬에서 사용할 수 있도록 만든것이다.  서적에는 원리나,  기본적인 방법을 설명하는 것이 매우 많이 적혀 있지만,   실무에서 거의 쓰지 않는 것까지 포함되어 있다.   이 부분은  다른  언어(R)로 주로 일을 하였지만,  실제 실무에서 많이 사용하는 것만 정리 하겠다.   쓰지 않는 것 까지 익히려고 애를 쓰게 되면 될 수록 학습의 피로감만 높아 진다. 

RST 6상 그래프 R plot 그리기

   RST 6상 그래프를 구글링해서 찾으러고 하니,  RST  3상만 나왔다.  RST 6상은 특수한 설비에서 작동되는 것이니,  나올 수가 없다.  교육용 자료로 만들려 하다 보니, 찾을 수가 없어 직접 그렸다. 

RST 3상은 360에서 3을 나누니,  120의 파형이 그래프로 보여지지만,   RST 6상은 360에서 6을 나누니 60도의 파형 그래프로 그려 졌다.   아래의 소스코드를 보고 그림을 그릴 수 있다. 


행렬(matrix)와 배열(array) 을 이용한 R 적용

 R에서 행렬(matrix)와  배열(array)를 쓰는 이유는 연산 속도의 사유로 많이 사용하게 된다.  dataframe으로 된  데이터 셋을 연산하게 되면 속도가 매우 느린 현상이 발생 하게 된다.   R에서 멀티코어 코딩을 하려면,  반드시 알고 넘어가야 하는 것이 행렬(matrix)와 배열(array)이다. 

집합 union(합집합), intersect(교집합), setdiff(차집합) 계산

  R에서 vector union(합집합), intersect(교집합), setdiff(차집합)은 실무에서는 데이터 기준을 세우고 돌릴때,  사용이 많이 된다.   벡터를 추가 하거나,  필요한 것만 불러 올 경우에는 집합 계산을 할 수 있다. 


포아송(Poisson) 분포 이론 및 R 예제

일반적으로 매우 회귀하여 일어날 확률이 아주 작은 경우에 포아송(Poisson) 분포를 사용한다. 예를 들어 고속도로 상에서 하루동안 발생하는 교통사고에 의한 사망자수, 어느 집에 한 시간 동안 걸려 오는 전화 통화수, 1주일간 어떤 동사무소에 접수되는 사망신고수, 하루동안 정전되는 횟수 등과 같이 회귀한 사건의 수를 확률 변수로 할때 이다.

구체적으로 포아송 분포가 적용되기 위해서는 다음의 가정을 만족하여야 한다.

  1. 독립성 : 한 단위 시간이나 공간에서 출현하는 성공횟수와 중복되지 않는 다른 단위 시간이나 공간에서 출현하는 성공횟수는 서로 독립이다.
  2. 비집략성 : 극히 작은 시간이나 공간에서 둘 또는 그 이상의 성공이 같이 일어날 확률은 매우 작으며 0으로 간주된다.
  3. 비례성 : 단위 시간이나 공간에서 성공의 평균출현횟수는 일정하며, 이는 시간이나 공간에 따라 변하지 않는다.

확률 분포 X가 위의 세가지 조건을 만족 할때, 성공의 평균출현 횟수를 m이라고 하고 하면 X의 확률 분포는 다음의 포아송 분포를 따른다.

R 4.2 Windows rJava 및 KOLNP 설치

KoLNP 로딩하면 아래와 같은 메시지가 나올 경우가 있다.  

warning message: in i.p(...) : 패키지 ‘c:/users/rdmkyg/appdata/local/temp/rtmps6vlku/file23e45dd83537/konlp_0.80.2.tar.gz’의 설치가 0이 아닌 종료상태를 가졌습니다

요새 R 4.2 버전을 설치 하면 나오는 메세지이다. 

[주식 클로드 자동매매 프로젝트] 제2편. 데이터 인프라 구축 — 모델보다 데이터가 먼저다

 머신러닝 모델을 이야기하기 전에, 그 모델이 먹는 데이터가 어디서 어떻게 왔는지부터 정직하게 밝혀야 한다. 이 프로젝트에서 가장 많은 시간이 들어간 부분은 화려한 모델 튜닝이 아니라, "내가 정말 그 데이터를 갖고 있는가"를 확인하...