• 제목/요약/키워드: Industry(Occupation) Code Classification

검색결과 7건 처리시간 0.025초

딥러닝 기법을 활용한 산업/직업 자동코딩 시스템 (An Automated Industry and Occupation Coding System using Deep Learning)

  • 임정우;문현석;이찬희;우찬균;임희석
    • 한국융합학회논문지
    • /
    • 제12권4호
    • /
    • pp.23-30
    • /
    • 2021
  • 본 산업/직업 자동코딩 시스템은 조사 대상자들이 응답한 방대한 양의 산업/직업을 설명하는 자연어 데이터에 통계 분류 코드를 자동으로 부여하는 시스템이다. 본 연구는 기존의 정보검색 기반의 산업/직업 자동코딩시스템과 다르게 딥러닝을 이용하여 색인 DB가 필요하지 않고 분류 수준에 상관없이 코드를 부여할 수 있는 시스템을 제안한다. 또한, 자연어 처리에 특화된 딥러닝 기법인 KoBERT를 적용한 제안 모델은 인구주택총조사 산업/직업 코드 분류, 그리고 사업체기초조사 산업 코드 분류에서 각각 95.65%, 91.45%, 97.66%의 Top 10 정확도를 보인다. 제안한 모델 실험 후 향후 개선 가능성을 데이터/모델링 관점으로 분석한다.

정보검색 기법을 이용한 산업/직업 코드 자동 분류 시스템 (An automated Classification System of Standard Industry and Occupation Codes by Using Information Retrieval Techniques)

  • 임희석
    • 컴퓨터교육학회논문지
    • /
    • 제7권4호
    • /
    • pp.51-60
    • /
    • 2004
  • 본 논문은 통계청에서 실시하는 인구 주택 총조사와 사업체 기초통계조사 시 실시되는 수작업에 의한 표준 산업/직업 코드 분류 시 발생하는 막대한 비용과 시간, 일관성의 결여 등을 해소하기 위한 표준 산업/직업 코드 자동 분류 시스템을 제안한다. 제안한 시스템은 정보 검색 기법과 문서 분류 기법을 이용하여 자연어로 기술된 레코드를 입력 받아 입력 레코드에 해당하는 분류 코드를 생성한다. 수작업으로 올바른 코드가 할당되어 있는 산업 분류 레코드 46,762개와 직업 분류 코드 36,286개를 이용하여 10-fold cross-validation evaluation을 수행한 결과, 제안한 시스템은 완전 자동 모드에서 2수준의 산업 분류에 대해서 87.08%, 5수준에 대해서는 66.08%의 생성률을 보였으며 반자동 모드에서는 각각 99.10%와 92.88%의 성능을 보였다. 직업 분류 코드에 대한 성능은 산업 분류 코드에 대한 성능보다는 약간 저하된 성능을 보였다. 제안한 시스템은 아직 수작업을 완전히 대체할 수 있는 완전 자동 분류기로서는 많은 개선의 여지를 가지고 있지만 수작업을 최소화할 수 있는 반자동 도구나 수작업의 정확도를 검증할 수 있는 보조 도구로써 충분히 활용될 수 있을 것으로 기대된다.

  • PDF

예제기반의 학습을 이용한 한국어 표준 산업/직업 자동 코딩 시스템 (An Automatic Coding System of Korean Standard Industry/Occupation Code Using Example-based Learning)

  • 임희석
    • 한국콘텐츠학회논문지
    • /
    • 제5권4호
    • /
    • pp.169-179
    • /
    • 2005
  • 통계청에서 실시하는 사업체 기초 조사와 인구주택총조사 과정에 업체와 개인에 대한 정보를 기술한 자연어를 표준 산업/직업 코드를 할당하는 수동 코딩 작업이 필요하다. 수동 코딩 작업은 막대한 인건비와 비용을 초래하고 수동 코딩 전문가의 능력과 기분에 따른 작업 결과의 비일관성이 매우 큰 문제로 지적되고 있다. 본 논문은 수작업으로 구축한 규칙베이스를 사용하는 규칙 기반 방법과 수작업으로 분류한 데이터를 이용하는 자동 학습 방법을 통합한 한국어 산업/직업 표준 코드 자동 생성 시스템을 제안한다. 제안하는 시스템은 인구주택총조사 40만 레코드, 사업체기초조사 40만 레코드를 이용하여 학습되었고, 실험데이터를 이용하여 평가되었다. 10-best 성능 평가 결과 제안된 시스템은 인구주택총조사 직업분류 데이터에 대해서 76.63%, 인구주택총조사 산업분류 데이터에 대해서 82.249%의 성능을 보였으며, 사업체기초 조사 산업분류 데이터에 대해서는 99.68%의 정확도를 보였다.

  • PDF

Improving the Classification of Population and Housing Census with AI: An Industry and Job Code Study

  • Byung-Il Yun;Dahye Kim;Young-Jin Kim;Medard Edmund Mswahili;Young-Seob Jeong
    • 한국컴퓨터정보학회논문지
    • /
    • 제28권4호
    • /
    • pp.21-29
    • /
    • 2023
  • 본 논문에서는 인구 조사에서 산업 및 직업 코드를 자동 분류하기 위한 인공지능 기반 시스템을 제안한다. 산업 및 직업 코드의 정확한 분류는 정책 결정, 자원 할당 및 연구를 위해 매우 중요하지만, 기존의 방식은 사람이 작성한 사례 사전에 의존하는 규칙 기반 방식으로 규칙 생성에 필요한 시간과 자원이 많이 소요되며 오류 발생 가능성이 높다. 우리는 본 논문에서 통계 기관에서 사용하는 기존의 규칙 기반 시스템을 대체하기 위해 사용자가 입력한 데이터를 이용하는 인공지능 기반 시스템을 제안하였다. 이 논문에서는 여러 모델을 학습하고 평가하여 산업에서 86.76%의 일치율, 직업에서 81.84%의 일치율을 달성한 앙상블 모델을 개발하였다. 또한, 분류 확률 결과를 기반으로 프로세스 개선 작업도 제안하였다. 우리가 제안한 방법은 전이 학습 기술을 활용하여 사전 학습된 모델과 결합하는 앙상블 모델을 사용하였으며, 개별 모델과 비교하여 앙상블 모델의 성능이 더 높아짐을 보였다. 본 논문에서는 인공지능 기반 시스템이 인구 조사 데이터 분류의 정확성과 효율성을 향상시키는 잠재력을 보여주며, 인공지능으로 이러한 프로세스를 자동화함으로써 더 정확하고 일관된 결과를 달성하며 기관 직원의 작업 부담을 줄일 수 있다는 점을 보여준다.

Assessing the Association Between Emotional Labor and Presenteeism Among Nurses in Korea: Cross-sectional Study Using the 4th Korean Working Conditions Survey

  • Jung, Sung Won;Lee, June-Hee;Lee, Kyung-Jae
    • Safety and Health at Work
    • /
    • 제11권1호
    • /
    • pp.103-108
    • /
    • 2020
  • Background: Presenteeism has emerged as an important health-related issue and has been studied in a variety of occupation groups. This study examines the relationship between emotional labor and presenteeism in nurses in Republic of Korea. Methods: As a cross-sectional study, our study was conducted on 328 female nurses participating in the fourth Korean Working Conditions Survey (2015). Nurses were identified by the Korean Industry Classification Code. Multivariable logistic regression analysis was performed to explore the association between emotional labor and presenteeism. Results: Female nurses who always or sometimes hide their emotions in the workplace were found to have a high risk for presenteeism compared with female nurses who rarely hide their emotions in the workplace {odds ratio [OR] = 2.40 [95% confidence interval (CI) 1.04-5.54]; OR = 4.12 [95% CI 1.72-9.84], respectively}. Furthermore, the risk of presenteeism was higher in nurses who sometimes engaged with complaining customers compared with nurses who rarely did so, but it lacked statistical significance. Conclusion: Presenteeism in nurses can cause various negative secondary effects; therefore, an alternative should be sought to mediate nurses' emotional labor to prevent presenteeism.

Developing Asbestos Job Exposure Matrix Using Occupation and Industry Specific Exposure Data (1984-2008) in Republic of Korea

  • Choi, Sangjun;Kang, Dongmug;Park, Donguk;Lee, Hyunhee;Choi, Bongkyoo
    • Safety and Health at Work
    • /
    • 제8권1호
    • /
    • pp.105-115
    • /
    • 2017
  • Background: The goal of this study is to develop a general population job-exposure matrix (GPJEM) on asbestos to estimate occupational asbestos exposure levels in the Republic of Korea. Methods: Three Korean domestic quantitative exposure datasets collected from 1984 to 2008 were used to build the GPJEM. Exposure groups in collected data were reclassified based on the current Korean Standard Industrial Classification ($9^{th}$ edition) and the Korean Standard Classification of Occupations code ($6^{th}$ edition) that is in accordance to international standards. All of the exposure levels were expressed by weighted arithmetic mean (WAM) and minimum and maximum concentrations. Results: Based on the established GPJEM, the 112 exposure groups could be reclassified into 86 industries and 74 occupations. In the 1980s, the highest exposure levels were estimated in "knitting and weaving machine operators" with a WAM concentration of 7.48 fibers/mL (f/mL); in the 1990s, "plastic products production machine operators" with 5.12 f/mL, and in the 2000s "detergents production machine operators" handling talc containing asbestos with 2.45 f/mL. Of the 112 exposure groups, 44 groups had higher WAM concentrations than the Korean occupational exposure limit of 0.1 f/mL. Conclusion: The newly constructed GPJEM which is generated from actual domestic quantitative exposure data could be useful in evaluating historical exposure levels to asbestos and could contribute to improved prediction of asbestos-related diseases among Koreans.

관우한국생태학적일개예설(关于韩国生态学的一个预设): 기우복장탑배적행위(基于服装搭配的行为) (Typology of Korean Eco-sumers: Based on Clothing Disposal Behaviors)

  • Sung, Hee-Won;Kincade, Doris H.
    • 마케팅과학연구
    • /
    • 제20권1호
    • /
    • pp.59-69
    • /
    • 2010
  • 绿色环保或者环境意识已经成为商业、政府机关, 以及消费者和世界关注的重要问题. 针对这一情况, 韩国政府宣布, 在本世纪初, "环保建设" 将被作为一种用以鼓励与环保相关的商业活动的方式. 不同层次的韩国服装业, 提出了不同的产品环保的绿色计划. 这些服装产品包括有机产品和回收的衣服. 要想使这些公司成功, 他们需要那些, 在做产品购买,使用, 处置时, 将绿色问题(如环境的可持续性发展)作为一个人判断的一个组成部分的顾客的信息. 这些消费者可以被看成是生态学的关注者. 过去的研究已经对消费者对于环保产品的购买意愿进行了检测. 此外, 还研究了影响生态保护者或绿色消费者的因素. 但是, 只是关注生态保护者在处置或者回收利用衣服上与采购绿色产品相比较是不够的. 服装处置行为有多种途径, 消费者可以用淘汰, 传承(例如: 把它送给一个年幼的弟弟), 赠与, 交换, 出售或者简单的把他扔掉等多种方式来暂时或者永久的摆脱闲置的衣服或贷款项目. 因此, 购买环保产品的行为应该结合服装处置的行为, 从而进一步了解消费者的消费行为与对环境的态度. 本项研究的目的在于提供韩国生态保护者从有利于生态学的角度出发来购买和处理衣服的生活方式的相关信息. 本研究的目标有: 1, 基于韩国对服装处置行为进行分类; 2, 调查人 们人口统计数据, 生活方式和服装消费价值观赏的差异; 3, 在环保的时尚物品的购买意愿和影响因素之间进行比较. 自填式的调查问卷是基于以往的研究设置出来的. 问卷包括10项处置衣服的条款, 22项可持续并且健康的生活方式的条款, 以及19项消费观念的条款. 根据利克特模板的五分量表设置. 此外, 购买两个时尚物品的意愿和每个物品属性的11项特征都是根据利克特模板的七分量表而来, 两种制成羊毛套衫的可以从PET识别代码的回收瓶子中创造出来的涤纶织物这两种套衫选自一个韩国和一个美国的户外运动服装的品牌. 我们对每一种产品的简介和颜色都进行了调查, 人口统计学(即性别, 年龄, 婚姻状况, 教育程度, 收入, 职业)也被包括在内. 在2009年5月份, 研究数据通过一个专业网站的调查机构进行采集, 最后有600份调查问卷可供分析, 这个调查的受访者年龄从20到49岁不等, 平均年龄为34岁. 百分之50的调查者为男性, 大约58%的受访者是已婚者, 其中62%的受访者有大学学位. 主要成分分析和因素最大方法差的方法用以识别衣服处理规模的潜在尺度. 共有三个因素生成(比如: 倒卖行为, 捐赠行为, 不回收利用行为). 基于他们处置衣服的方式对受访者进行了分类, 群类分析被使用, 最终得到了三个部分. 不同的消费者, 被分别贴上 "转售集团", "捐资团体" 以及 "不回收组织" 的标签加以分类, 其中98%是正确的分类. 从人口统计学角度来看, 这三个类别的人在性别, 婚姻状况, 职业和年龄上有显著的差异. 健康可持续的生活方式被缩减为以下5个因素: 自我满意度, 家庭定位, 健康问题, 环境问题和自愿的服务. 这是三个群体中健康可持续的生活方式的最显著的差异. 转售集团和捐赠组表现出在健康可持续的生活方式上的相同倾向, 同时, 不回收集团在生活方式方面呈现最低的平均值. 转售和捐赠团体自称享受和满意这种生活和消费方式, 并且能够利用空余的时间陪伴家人. 另外, 这两组的人关心健康和有机食品, 并试图保护能源和资源. 对服装消费的价值观产生主要影响的三个因素是: 个人价值, 社会价值和实用价值. 因素的方差测试表明转售集团和其他两组之间的因素差异最大. 转售集团相比其他价值更关注个人价值和社会价值. 相比之下, 非回收集团比捐赠集团更关注高层次的社会价值. 比较购买环保产品的意愿上, 转售集团表现出最高的购买A类产品的意愿. 另一方面, 捐赠集团则在小市场中表现出购买B类产品的最高意愿. 此外, 平均分数表明, 购买韩国的产品(B类产品)相比购买美国的产品(A类产品)更合韩国人的心意. 多元线性回归分析法确定了对环保产品的购买的意愿对制造业产品属性的影响. 产品的设计, 价格, 贡献, 对环境的保护, 价格, 兼容性是影响转售集团的显著因素, 另外, 以及对自身形象的影响是捐赠团体的重要因素. 对于非回收集团来说, 设计, 价格等因素是相同的, 自我的形象,对环保运动的贡献, 和环境保护也是很重要的. 而价格因素具有显著性的共通性. 对于B类产品来说, 设计, 合理的价格, 形象等因素是同等的重要, 但是不同的组对购买的特征和意愿有不同的倾向. 健康可持续的生活方式以及服装消费的意向对购买A类产品和B类产品的影响同样被我们所关注. 实际操作者的健康状况和个人价值都是影响购买意愿的重要因素; 然而, 在这三个群体中说服的力度都很低. 结果表明, 分类出来的每组处理服装的行为, 显示着不同服装产品的属性, 个人价值, 和实践者的特点, 这些都影响了他们的购买环保产品的意愿, 结果会使生态保护者提出并组织更合理的生态设计的战略决策.