서로 다른 source의 data를 통합, 분석하기 위해서는
각 DB의 ID 를 mapping하는 작업이 필요하다.
이를 위한 mapping DB를 소개한다.
UniProt 과 PDB 간의 mapping
: http://www.bioinf.org.uk/pdbsws/
UniProt, PDB와 EC 의 mapping
: http://www.bioinf.org.uk/pdbsprotec/
UniProt, PDB, NCBI 간의 mapping
: http://www.pir.uniprot.org/search/idmapping.shtml
IPI protein cross reference (UniProt-Ensenble-Refseq-GI )
: http://www.ebi.ac.uk/IPI/xrefs.html
NCBI Gene mapping
: NCBI ftp 접속 후, gene/DATA 디렉토리 하의
gene2accession.gz, gene2refseq.gz, gene_refseq_uniprot_collob.gz 등
일련의 파일을 통해 NCBI에 등록된 gene의
-rma accession, gene accession, protein accession 과 이들의 gi
-protein accession 과 uniprot id
등의 관계를 mapping.
하나의 gene은 NCBI에서 rma, gene, protein 으로 나누어 accession id를
가지게 되고, 이들 각각의 고유한 gi 값도 가지게 되는데, 외부의
cross-mapping DATA는 주로 이들 중 하나의 accession id와의 mapping
정보만을 담고 있어, 원하는 DB cross-mapping 을 할 수 없을 때가 많다.
Affymextrix gene chip의 각 probe 와 protein 을 mapping하고자 하는 경우,
affymetrix chip description file과 R의 annaffy 패키지를 통해 제공하는 정보는
NCBI의 'NM_xxxxx' 형태의 NCBI RMA accession ID 인데, Protein DB가 제공하는
mapping 정보는 NP_xxxxx 형태의 NCBI protein accession ID 다.
이를 위해서는 NCBI에서 제공되는 위의 파일들을 다운 받아, RMA와 protein 의
NCBI accession ID를 mapping 하는 작업이 선행되어야 한다.
Mainly on Personal Genome Industry, Preventable Medicine, Mobile healthcare tech, and Bioinformatics.
Thursday, January 10, 2008
Wednesday, January 9, 2008
Integrating gene expression data with other biological data
Microarray data 를 이용한 연구가 많이 이뤄져왔고, 이루어지고 있지만, 기술적인 한계 or 생물학적 시스템의 불안정성으로 인해 각 데이터 간의 재연성이 높지 않고, 따라서 신뢰도가 떨어지는 실정이다. 생물학 시스템이 정확히 하나의 expression pattern 그대로 있는 시간은 얼마나 될까? Microarray 실험을 하기 위한 sample을 얻는 시간을 컨트롤하여 정확하게 같은 expression pattern을 재연할 수 있을까?
똑같은 Pancreatic cancer cell에 대한 expression pattern도 cell을 둘러싼 환경에 따라, 시간에 따라 달라진다. 서로 다른 환자에게서 추출된 cancer cell 간의 pattern 이라면 영향을 끼치는 factor들은 더욱 많아지게 된다. Gene expression pattern의 재연성이 떨어지는 것은 이러한 정황을 고려해 볼 때 당연한 결과인지 모른다.
Expression pattern을 통해 목적하는 일 중 대부분이 Biomarker selection 이다. Lung cancer를 일으키는 gene은? Diabetis를 일으키는 gene은? 이런 식으로 찾아낸 gene을 가지고 drug target을 삼고, drug discovery에 돌입하는 traditional research paradigm 이 궁극적인 목적이 된다.
그러나 아이러니하게 gene expression data는 오히려 이런 old paradigm 보다는, 전체적인 expression 양상, 단일한 gene이 아닌 전체적인 gene들의 발현 양상이 서로 어떻게 연관되어 있는지를 연구할 수 있는 new paradigm에 적합하다.
Protein interaction, gene interaction, coexpression analysis 등과의 접목을 통해 expression data를 1차원에서 2차원, 3차원으로 높여 분석할 때, 이런 Global, Local gene expression pattern 뒤에 감춰진 의미를 더욱 잘 이해할 수 있을 것이다.
똑같은 Pancreatic cancer cell에 대한 expression pattern도 cell을 둘러싼 환경에 따라, 시간에 따라 달라진다. 서로 다른 환자에게서 추출된 cancer cell 간의 pattern 이라면 영향을 끼치는 factor들은 더욱 많아지게 된다. Gene expression pattern의 재연성이 떨어지는 것은 이러한 정황을 고려해 볼 때 당연한 결과인지 모른다.
Expression pattern을 통해 목적하는 일 중 대부분이 Biomarker selection 이다. Lung cancer를 일으키는 gene은? Diabetis를 일으키는 gene은? 이런 식으로 찾아낸 gene을 가지고 drug target을 삼고, drug discovery에 돌입하는 traditional research paradigm 이 궁극적인 목적이 된다.
그러나 아이러니하게 gene expression data는 오히려 이런 old paradigm 보다는, 전체적인 expression 양상, 단일한 gene이 아닌 전체적인 gene들의 발현 양상이 서로 어떻게 연관되어 있는지를 연구할 수 있는 new paradigm에 적합하다.
Protein interaction, gene interaction, coexpression analysis 등과의 접목을 통해 expression data를 1차원에서 2차원, 3차원으로 높여 분석할 때, 이런 Global, Local gene expression pattern 뒤에 감춰진 의미를 더욱 잘 이해할 수 있을 것이다.
Thursday, January 3, 2008
은행 적금 금리와 펀드의 수익률
똑같은 이자율이라 하더라도 은행 적금과 펀드의 이자율은
액면 그대로 받아들일 수 없는 간극이 있다.
7%의 이자율로 은행 정기 적금을 들면 월 20만원 납입시
1년 후 붙는 이자는 78,000원이다. (200,000*0.07*13/2)
반면 20만원씩 적립식 펀드에 가입하고 1년 후 누적 수익률이
7%인 경우에 붙은 이자는 168,000원이다. ( 240*0.07 )
그러나, 대개 펀드의 1년 수익률을 얘기할 때의 수익률은
누적 수익률이 아니라, 말 그대로 1년 전의 불입금에 해당하는
수익률이다. 2006년 1월 20만원에 대해 2007년 1월 14,000원의
수익이 발생한 경우 이 펀드의 1년 수익률이 7%라고 얘기한다.
이 기간 동안 펀드의 수익률이 오르락 내리락 했을 경우, 매달
불입한 20만원에 대한 수익률은 각기 다르고, 전체 불입금에
대한 누적 수익률은 7%가 한참 못 미칠 수도 있고, 한참
위일 수도 있다.
액면 그대로 받아들일 수 없는 간극이 있다.
7%의 이자율로 은행 정기 적금을 들면 월 20만원 납입시
1년 후 붙는 이자는 78,000원이다. (200,000*0.07*13/2)
반면 20만원씩 적립식 펀드에 가입하고 1년 후 누적 수익률이
7%인 경우에 붙은 이자는 168,000원이다. ( 240*0.07 )
그러나, 대개 펀드의 1년 수익률을 얘기할 때의 수익률은
누적 수익률이 아니라, 말 그대로 1년 전의 불입금에 해당하는
수익률이다. 2006년 1월 20만원에 대해 2007년 1월 14,000원의
수익이 발생한 경우 이 펀드의 1년 수익률이 7%라고 얘기한다.
이 기간 동안 펀드의 수익률이 오르락 내리락 했을 경우, 매달
불입한 20만원에 대한 수익률은 각기 다르고, 전체 불입금에
대한 누적 수익률은 7%가 한참 못 미칠 수도 있고, 한참
위일 수도 있다.
Thursday, November 29, 2007
Effect of gene mutation on phenotype
URL : http://genomebiology.com/content/pdf/gb-2007-8-11-r252.pdf
Gene mutation이 phenotype에는 과연 어떤 영향을 미칠까?
이는 SNP 연구의 핵심이 되는 질문이다.
Species간, 각 human 개체간의 genetic variation이
어떤 영향을 끼쳐, species간 혹은 개체 간의 variation을
만들어 낼까?
이 논문에서는 protein complex를 이용해 gene mutation
의 phenotypic effect를 설명한다.
Gene mutation이 phenotype에는 과연 어떤 영향을 미칠까?
이는 SNP 연구의 핵심이 되는 질문이다.
Species간, 각 human 개체간의 genetic variation이
어떤 영향을 끼쳐, species간 혹은 개체 간의 variation을
만들어 낼까?
이 논문에서는 protein complex를 이용해 gene mutation
의 phenotypic effect를 설명한다.
Blast options for ortholog gene finding
URL :http://bioinformatics.oxfordjournals.org/cgi/content/abstract/btm585v1
서로 다른 두 species 간의 ortholog 를 찾는 방법은
Reciplocal best blast hit,
Reciplocal best distance hit
방법 등 여러가지가 있는데, blast를 이용한 방법이
사용의 편의성에 기인해 널리 쓰인다.
위의 논문에서는 Blast option을 바꾸는 것 만으로
ortholog finding accuracy를 높이는 방법을
제안한다.
서로 다른 두 species 간의 ortholog 를 찾는 방법은
Reciplocal best blast hit,
Reciplocal best distance hit
방법 등 여러가지가 있는데, blast를 이용한 방법이
사용의 편의성에 기인해 널리 쓰인다.
위의 논문에서는 Blast option을 바꾸는 것 만으로
ortholog finding accuracy를 높이는 방법을
제안한다.
Tuesday, November 27, 2007
왜 장기 투자를 해야 하는가?
국내 주식 시작에 투자하는 대한민국 대표펀드
미래에셋 디스커버리주식 1호는 현재까지 약 778%의
수익률을 마크하고 있다.
펀드가 시작된 2001년에 1억을 넣어놓고, 그대로 유지하기만
했어도 현재 약 8억 8천만원으로 불릴 수 있었다는 얘기다.
같은 돈으로 같은 기간 동안 수익률이 많이 오를 때 마다 넣었다
뺐다를 반복한 사람의 수익률은 어떨까? 얼핏 생각해서 많이 올랐을 때
팔고, 많이 떨어졌을 때 다시 매수를 한다면 그냥 넣어두고 있었던
것 보다 더 좋은 수익률을 기록할 수 있지 않을까 생각하기 쉽지만,
이는 주가가 언제 오르고, 떨어질지를 정확하게 예측할 때만 가능한
한 마디로 신이 아니고는 할 수 없는 일이다.
이런 식으로 투자를 하면서 주가가 많이 올랐던 상위 10일만을
투자 하지 못했다고 한다면 어떨까? 차트에서 보는 바와 같이
220% 가량의 수익률이 날아간다. 상위 20일, 30일 로 가면
수익률이 절반에도 못 미친다는 것을 알 수 있다.
7년여의 기간 중 단 수십일 펀드 투자를 계속 유지하느냐,
하지 않았느냐에 따라 엄청난 수익률의 차이가 발생하는 것이다.
투자의 기본은 장기 투자, 분산 투자다.
문제는 이 기본을 지킬 수 있는가다.
매일매일의 신문 기사와 증시 시황에 흔들리고
불안에 떨 만큼 '투자'가 불안하다면
안전한 은행에 넣어놓고 콩고물 같은
이자만 받으며 만족해야 할 수밖에 없다.
Wednesday, November 21, 2007
Fun&Co
Article source : Bioinformatics, 23, 2725, 2007
두 그룹의 microarray data set의 functional difference를
비교하고자 할 때 ( e.g. 서로 다른 tissue, disease vs. normal 등)
사용할 수 있는 방법으로 fun&co 이라는 web server가 공개되었다.
Procedure는 아래와 같다.
1. 각 그룹의 intensity를 rank로 변환
2. 가능한 모든pair probe set에 대해 spearman correlation coefficient 계산
3. pair probe set이 동일한 gene을 detection하는 경우가 아닐 때, 연관된 GOmain term을 counting
4. 각 그룹의 counting 된 GO term set을 비교하여, 그룹과 Over-correlated or under-correlated 된 GO 를 선정
다른 방법들과 구분되는 특이한 점이라면,
하나의 GO term을 지칭하는 Pair gene이
correlation되는 경우 연관된 GO term에만
의미를 두었다는 것이다.
이는 multi data set comparision의 경우 몇가지 advantage를 가지는데
1. 각 data set에서 DEG test를 할 필요가 없다는 점
2. 따라서 normal condition에 대한 고려가 필요없는 경우 ( 서로 다른 tissue 비교와 같은 경우), 각 data set에서 관련된 array만 고려하면 된다는 점
등이 된다.
두 그룹의 microarray data set의 functional difference를
비교하고자 할 때 ( e.g. 서로 다른 tissue, disease vs. normal 등)
사용할 수 있는 방법으로 fun&co 이라는 web server가 공개되었다.
Procedure는 아래와 같다.
1. 각 그룹의 intensity를 rank로 변환
2. 가능한 모든pair probe set에 대해 spearman correlation coefficient 계산
3. pair probe set이 동일한 gene을 detection하는 경우가 아닐 때, 연관된 GOmain term을 counting
4. 각 그룹의 counting 된 GO term set을 비교하여, 그룹과 Over-correlated or under-correlated 된 GO 를 선정
다른 방법들과 구분되는 특이한 점이라면,
하나의 GO term을 지칭하는 Pair gene이
correlation되는 경우 연관된 GO term에만
의미를 두었다는 것이다.
이는 multi data set comparision의 경우 몇가지 advantage를 가지는데
1. 각 data set에서 DEG test를 할 필요가 없다는 점
2. 따라서 normal condition에 대한 고려가 필요없는 경우 ( 서로 다른 tissue 비교와 같은 경우), 각 data set에서 관련된 array만 고려하면 된다는 점
등이 된다.
Subscribe to:
Posts (Atom)