정규 표현식은 Pandas 시리즈 하위 문자열 필터링 성능을 어떻게 향상시킬 수 있습니까?-파이썬 튜토리얼-php.cn

집

백엔드 개발

파이썬 튜토리얼

정규 표현식은 Pandas 시리즈 하위 문자열 필터링 성능을 어떻게 향상시킬 수 있습니까?

DDD

Nov 27, 2024 am 12:14 AM

How Can Regular Expressions Improve Pandas Series Substring Filtering Performance?

Pandas 시리즈의 다중 하위 문자열 필터링 성능 개선

특정 문자열 열에 하나 이상의 하위 문자열이 포함된 행을 필터링하려고 할 때 주어진 목록에 따르면 np.logical_or.reduce()를 사용하는 기존 방법은 대규모 데이터 세트에 비효율적일 수 있습니다. 이 기사에서는 성능 향상을 위해 정규식을 활용하는 대체 접근 방식을 살펴봅니다.

제안된 솔루션

str.contains()에서 regex=False를 사용하는 대신 정규식을 사용합니다. re.escape()를 사용하여 제공된 하위 문자열을 올바르게 이스케이프한 후. 이렇게 하면 정규식 해석이 아닌 문자 그대로의 일치가 보장됩니다. 그런 다음 이스케이프된 하위 문자열은 정규식 파이프(|)를 사용하여 단일 패턴으로 결합됩니다.

마스킹 프로세스

마스킹 단계는 시리즈 전체의 루프가 되어 다음 사항을 확인합니다. 각 문자열은 다음 패턴과 일치합니다:

df[col].str.contains(pattern, case=False)

성능 비교

길이가 5인 100개의 하위 문자열과 길이가 20인 50,000개의 문자열이 있는 샘플 데이터셋을 사용하여 제안한 방법은 약 1초가 걸렸습니다. 원래 방법은 동일한 데이터에 대해 약 5초가 걸렸습니다.

참고

이 솔루션은 하위 문자열 일치가 없는 "최악의 경우" 시나리오를 가정합니다. 일치하는 경우 성능이 더욱 향상됩니다. 또한 이 접근 방식은 초기 방법보다 효율적이므로 행당 필요한 확인 횟수가 줄어듭니다.

위 내용은 정규 표현식은 Pandas 시리즈 하위 문자열 필터링 성능을 어떻게 향상시킬 수 있습니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

관련 기사

파이썬 : 컴파일러 또는 통역사?May 13, 2025 am 12:10 AM

Python은 해석 된 언어이지만 편집 프로세스도 포함됩니다. 1) 파이썬 코드는 먼저 바이트 코드로 컴파일됩니다. 2) 바이트 코드는 Python Virtual Machine에 의해 해석되고 실행됩니다. 3)이 하이브리드 메커니즘은 파이썬이 유연하고 효율적이지만 완전히 편집 된 언어만큼 빠르지는 않습니다.

루프 대 루프를위한 파이썬 : 루프시기는 언제 사용해야합니까?May 13, 2025 am 12:07 AM

USEAFORLOOPHENTERATINGOVERASERASERASPECIFICNUMBEROFTIMES; USEAWHILLOOPWHENTINUTIMONDITINISMET.FORLOOPSAREIDEALFORKNOWNSEDINGENCENCENS, WHILEWHILELOOPSSUITSITUATIONS WITHERMINGEDERITERATIONS.

파이썬 루프 : 가장 일반적인 오류May 13, 2025 am 12:07 AM

Pythonloopscanleadtoerrors likeinfiniteloops, modifyinglistsdizeration, off-by-by-byerrors, zero-indexingissues, andnestedloopineficiencies.toavoidthese : 1) aing'i

파이썬의 루프 및 루프의 경우 : 각각의 장점은 무엇입니까?May 13, 2025 am 12:01 AM

ForloopSareadvantageForkNowniTerations 및 Sequence, OffingSimplicityAndInamicConditionSandunkNowniTitionS 및 ControlOver Terminations를 제공합니다

파이썬 : 편집과 해석에 대한 깊은 다이빙May 12, 2025 am 12:14 AM

Pythonusesahybridmodelofilationandlostretation : 1) ThePyThoninterPretreCeterCompileSsourcodeIntOplatform-IndependentBecode.

Python은 해석 된 또는 편집 된 언어입니까? 왜 중요한가?May 12, 2025 am 12:09 AM

Pythonisbothingretedandcompiled.1) 1) it 'scompiledtobytecodeforportabilityacrossplatforms.2) thebytecodeisthentenningreted, withfordiNamictyTeNgreted, WhithItmayBowerShiledlanguges.

루프 대 파이썬의 루프 : 주요 차이점 설명May 12, 2025 am 12:08 AM

forloopsareideal when

루프를위한 것 및 기간 : 실용 가이드May 12, 2025 am 12:07 AM

forloopsareusedwhendumberofitessiskNowninadvance, whilewhiloopsareusedwhentheationsdepernationsorarrays.2) whiloopsureatableforscenarioScontiLaspecOndCond

See all articles