Go言語のregexpで日本語(Unicode)を扱う方法を徹底解説!初心者向け正規表現ガイド
生徒
「Go言語の正規表現で、日本語ってちゃんと扱えるんですか?」
先生
「はい、Go言語のregexpパッケージはUnicodeに対応しているので、日本語も問題なく扱えます。」
生徒
「Unicodeって何ですか?」
先生
「世界中の文字を共通のルールで扱う仕組みです。日本語や英語、記号などを一つの基準で扱えるようにするものです。」
生徒
「なるほど!じゃあGo言語で日本語を検索したりできますか?」
先生
「できます。基本から順番に見ていきましょう。」
1. Go言語のregexpパッケージとは
Go言語のregexpパッケージとは、文字列の検索や置換を行うための機能です。正規表現というルールを使って、特定のパターンに一致する文字列を見つけることができます。
例えば、メールアドレスのチェックや電話番号の抽出などで使われます。Go言語では標準ライブラリとして提供されているため、特別なインストールは不要です。
2. Unicodeと日本語対応の基本
Unicodeとは、世界中の文字を一つのルールで扱うための仕組みです。日本語のひらがな、カタカナ、漢字もすべてUnicodeで管理されています。
Go言語のregexpはUnicode対応なので、日本語をそのまま書いて検索できます。初心者でも安心して使えるのが特徴です。
3. 日本語をそのまま検索する方法
まずは一番簡単な方法として、日本語をそのまま正規表現に書いて検索する方法を紹介します。
package main
import (
"fmt"
"regexp"
)
func main() {
text := "こんにちは、Go言語です"
re := regexp.MustCompile("こんにちは")
fmt.Println(re.MatchString(text))
}
このコードでは、「こんにちは」という日本語が含まれているかをチェックしています。
true
このように、日本語は特別な設定なしでそのまま扱うことができます。
4. Unicodeプロパティを使った日本語判定
Unicodeプロパティとは、文字の種類を指定する方法です。例えば、ひらがなや漢字などを指定できます。
package main
import (
"fmt"
"regexp"
)
func main() {
text := "abcあいう123"
re := regexp.MustCompile(`\p{Hiragana}+`)
fmt.Println(re.FindString(text))
}
あいう
この例では、ひらがなだけを取り出しています。Unicodeプロパティを使うことで、より細かく日本語を扱うことができます。
5. 漢字やカタカナを扱う方法
ひらがなだけでなく、カタカナや漢字も同様に扱えます。
package main
import (
"fmt"
"regexp"
)
func main() {
text := "東京タワーとスカイツリー"
re := regexp.MustCompile(`\p{Han}+`)
fmt.Println(re.FindAllString(text, -1))
}
[東京]
Hanは漢字を意味します。このようにUnicodeプロパティを使うと、日本語の種類ごとに処理できます。
6. 日本語を含む文字列の置換処理
正規表現は検索だけでなく、置換にも使えます。日本語も同じように置き換え可能です。
package main
import (
"fmt"
"regexp"
)
func main() {
text := "私はGoが好きです"
re := regexp.MustCompile("Go")
result := re.ReplaceAllString(text, "Golang")
fmt.Println(result)
}
私はGolangが好きです
このように、日本語と英語が混ざった文章でも問題なく処理できます。
7. 注意点と初心者がつまずきやすいポイント
Go言語で日本語の正規表現を扱うときの注意点として、文字のバイト数があります。日本語は一文字が複数バイトで表現されるため、単純な文字数計算とは異なります。
また、正規表現の書き方ではバックスラッシュの扱いにも注意が必要です。バッククォートを使うことでエスケープを減らせるので、初心者にはおすすめです。
8. Go言語で日本語正規表現を使うメリット
Go言語のregexpはシンプルで高速に動作するのが特徴です。日本語処理にも強く、Web開発やデータ処理で非常に役立ちます。
特にログ解析やテキスト処理では、日本語を含むデータを効率よく扱えるため、実務でもよく使われています。
まとめ
本記事では、Go言語のregexpパッケージを活用して日本語を扱う方法について、基礎から応用まで丁寧に解説してきました。Go言語の正規表現はUnicodeに標準対応しているため、日本語のひらがな、カタカナ、漢字を特別な設定なしで扱える点が大きな特徴です。これにより、初心者でも安心して日本語テキスト処理を行うことができます。 まず、regexpパッケージの基本的な使い方として、文字列の検索や一致判定を学びました。日本語をそのまま正規表現に記述することで、直感的に検索できる点は非常に便利です。さらに、Unicodeプロパティを利用することで、ひらがなや漢字など特定の文字種を抽出する高度な処理も可能になります。 また、正規表現は検索だけでなく置換処理にも活用でき、日本語と英語が混在する文章でも柔軟に対応できることを確認しました。実務においては、ログ解析やデータ整形、ユーザー入力の検証など、幅広い場面で役立ちます。 注意点として、日本語はマルチバイト文字であるため、文字数とバイト数の違いを理解することが重要です。さらに、正規表現の記述ではバッククォートを活用することで、エスケープ処理を簡潔にできるため、可読性の高いコードを書くことができます。 Go言語の正規表現は高速でシンプルな設計となっており、日本語処理においても高いパフォーマンスを発揮します。これらの特徴を理解し、実際のプログラムに応用することで、効率的で信頼性の高いテキスト処理が実現できます。 今後は、より複雑なパターンマッチングやデータ抽出にも挑戦し、Go言語の正規表現スキルをさらに高めていきましょう。
サンプルプログラムで振り返り
package main
import (
"fmt"
"regexp"
)
func main() {
text := "大阪でGo言語を学ぶ2026"
re := regexp.MustCompile(`\p{Han}+`)
result := re.FindAllString(text, -1)
fmt.Println(result)
}
[大阪 言語 学]
このように、Unicodeプロパティを使うことで漢字だけを抽出することができ、日本語テキスト処理の幅が大きく広がります。Go言語のregexpを使いこなすことで、検索、抽出、置換といった処理を効率的に実現できます。
生徒
「Go言語の正規表現って、日本語もそのまま使えるのがすごく便利ですね。」
先生
「その通りです。Unicode対応のおかげで、日本語処理がとても簡単になっています。」
生徒
「ひらがなや漢字を分けて扱えるのも驚きました。」
先生
「Unicodeプロパティを使えば、文字の種類ごとに柔軟な処理ができます。実務でもよく使われます。」
生徒
「置換処理もできるので、データ加工にも使えそうですね。」
先生
「はい。ログ解析や入力チェックなど、さまざまな場面で活用できます。」
生徒
「日本語はバイト数に注意が必要というのも理解できました。」
先生
「そこは初心者がつまずきやすいポイントなので、しっかり覚えておきましょう。」
生徒
「これからはGo言語で日本語のテキスト処理にも挑戦してみます。」
先生
「ぜひ実践してみてください。理解が深まりますよ。」
【超入門】ゼロから始めるGo言語プログラミング:最速で「動くアプリ」を作るマンツーマン指導
「プログラミングの仕組み」が根本からわかる。Go言語でバックエンド開発の第一歩を。
本講座を受講することで、単なる文法の暗記ではなく、「プログラムがコンピュータの中でどう動いているか」という本質的な理解につながります。シンプルながら強力なGo言語(Golang)を通じて、現代のバックエンドエンジニアに求められる基礎体力を最短距離で身につけます。
具体的な開発内容と環境
【つくるもの】
ターミナル(黒い画面)上で動作する「対話型計算プログラム」や、データを整理して表示する「ミニ・ツール」をゼロから作成します。自分の書いたコードが形になる感動を体験してください。
【開発環境】
プロの現場でシェアNo.1のVisual Studio Code (VS Code)を使用します。インストールから日本語化、Go言語用の拡張機能設定まで、現場基準の環境を一緒に構築します。
この60分で得られる3つの理解
「なぜ動くのか」という設定の仕組みを理解し、今後の独学で詰まらない土台を作ります。
データの種類やメモリの概念など、他言語にも通じるプログラミングの本質を学びます。
ただ動くだけでなく、誰が見ても分かりやすい「綺麗なコード」を書くための考え方を伝授します。
※本講座は、将来的にバックエンドエンジニアやクラウドインフラに興味がある未経験者のためのエントリー講座です。マンツーマン形式により、あなたの理解度に合わせて進行します。
初めてのGo言語を一緒に学びましょう!