【语法算法】
一、一个不报错的报错
昵称限六个字,str:sub(1, 12) 截前十二个字节——测试服全绿,海外服却冒出一批"昵称含非法字符"的拦截。翻日志,被拦的昵称末尾都是半个乱码:一个三字节的汉字被拦腰切掉一个字节,剩下的残字节落进了校验循环。没有一行代码抛错,错误却真实存在:Lua 的 string.sub 按字节切,不知道"字"是什么。字符串长度、截断、定位全部错位的根源,要从 UTF-8 的编码规则说起。
二、底层原理:首字节前缀定宽度
UTF-8 是变长编码,一个字符占一到四字节。宽度信息全部藏在首字节的高位前缀里:0xxxxxxx 开头是一字节,110xxxxx 是两字节,1110xxxx 是三字节,11110xxx 是四字节;后续字节一律 10xxxxxx 打头,永远不当首字节。于是"逐字处理"退化为一个字节游标:看首字节、跳对应宽度、游标落点必是下一个字符的首字节。#str 拿到的是字节数不是字数,混排字符串里两者没有任何换算关系。
flowchart LR
A["字节游标 i = 1"] --> B{"string.byte(s, i)<br/>读首字节"}
B -- "≤127 → 宽 1" --> C["i = i + 1"]
B -- "192~223 → 宽 2" --> D["i = i + 2"]
B -- "224~239 → 宽 3" --> E["i = i + 3"]
C --> F{"i ≤ #str ?"}
D --> F
E --> F
F -- 是 --> B
F -- 否 --> G["遍历结束<br/>字符数 = 跳跃次数"]
三、正确写法(可直接落地)
local function chsize(byte)
if not byte then
return 0
elseif byte > 240 then
return 4
elseif byte > 225 then
return 3
elseif byte > 192 then
return 2
else
return 1
end
end
-- 计算真实字数: utf8len("1你好") => 3
function UTF8Length(str)
local len, i = 0, 1
while i <= #str do
i = i + chsize(string.byte(str, i))
len = len + 1
end
return len
end
-- 按字符数截断: utf8sub("你好ABC", 2, 3) => "好AB"
function UTF8Sub(str, startChar, numChars)
local i = 1
while startChar > 1 do -- 先游标走到起始字符
i = i + chsize(string.byte(str, i))
startChar = startChar - 1
end
local j = i
while numChars > 0 and j <= #str do -- 再数 numChars 个字符
j = j + chsize(string.byte(str, j))
numChars = numChars - 1
end
return str:sub(i, j - 1) -- 落点必是字符边界
end
四、显示宽度:中文算两格的截断
聊天框、玩家名真正的需求不是"截六个字",是"截十二格显示宽度"——中文占两格、英文占一格。把 chsize 返回的字节数换成显示宽度(宽度大于一记二,否则记一),游标逻辑原封不动,就是 show_sub:预算扣完即停,扣不完的半格只装得下英文字符。这就是为什么"哈哈hh"截四格剩"哈哈",截三格剩"哈h"——宽度账算得清清楚楚。
五、老手再看一眼
三个细节值得刻进肌肉记忆:第一,全程只用 string.byte 按字节跳跃,不切子串、不建中间表,单次遍历零分配,#str 是 O(1) 的元数据读取;第二,chsize 的四个阈值判断是无序 if 链,热路径里建议把 chsize 提为局部函数,省掉全局查找;第三,这套游标算法同样适用于敏感词过滤、@解析、表情混排——凡是"按字符"操作字符串的前端需求,先问一句:我的游标认得首字节前缀吗?
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
【语法算法】 闭包工厂的本质就这一行: 外层函数接收配置,返回一个闭包——闭包捕获配置,后续调用使用捕获的配置——闭包工厂的…
【语法算法】 闭包工厂的本质就这一行: 外层函数接收配置,返回一个闭包——闭包捕获配置,后续调用使用捕获的配置——闭包工厂的…
【语法算法】 泛型 for 的四种形态就这两行: 泛型 for 的四种形态覆盖了 Lua 所有的遍历需求——从无序遍历到有序…
【语法算法】 string.find 的起始偏移就这一行: 第三个参数 init 是搜索的起始偏移——从字符串的第 init…
【语法算法】 CPU 时间和墙钟时间的分界就这两行: os.clock 返回 CPU 时间——程序实际占用处理器的秒数——o…
【语法算法】 元方法 __unm 的触发就这一行: 对带 __unm 的表做一元负号操作 -t 时,Lua 调用 __unm…