網站可能被牆,請記住以下域名:subhd.me subhd.one
感觉「原创翻译」这个标签不需要存在了
Jack

现在的「原创翻译」和以前已经不是一个概念了,全是基于AI翻译了,考虑把这个标签封闭,以前的「原创翻译」保留,字幕组发的字幕列为「精选推荐」。

但是只有「其他来源」「官方译本」「AI翻译」三个标签似乎也不够用
發表留言 共 8 条

魔满月
就韩剧而言,官方字幕最好写清楚是哪里的官方字幕,如果匹配视频版本里没有写缩写的(NF、DSNP、AMZN、friDay、VIU、iQiyi、HBOmax、CATCHPLAY、Viki、KKTV、Linetv、MyVideo、TVING、CP、Wavve等等)至少要在说明里写清楚,不能就简单WEB-DL都当官方字幕

蒙太奇字幕组
不知道AI能否判断出原创翻译和AI翻译呢?也许下载量和点赞高的可以让AI判断下,加上原创翻译头衔?
蒙太奇字幕组
@蒙太奇字幕组:所以也许最终办法就是人类审核,确认是长期发原创翻译的,允许他们勾选“原创翻译”,但是不面向普通用户开启,必须先发布一些原创翻译后来申请才能开启。

这就要麻烦了,但是可能是唯一可靠的方式。
蒙太奇字幕组
@Jack:我记得22年、23年刚出LLM的时候,很多学校是严禁使用LLM写论文的,那时候有很多开源的检测器项目,可以检测一段文本是不是LLM写的,或者LLM润色的,后来发现LLM大家都在用,利大于弊,也就放开了。

这些检测器对于英文内容识别率是比较高的,对于中文识别率很低,因为中文语法结构下很难找到那种LLM修改、创建后明显的统计模式。

所以LLM检测器在中文里实际上一直没有发展起来。

这是我找到的几个中文检测器项目,你可以看下:
https://github.com/free-revalution/AIGC-Detector-Pro
https://github.com/zejunwang1/GPTDetector

还有就是随着模型的不同,生成的语气、模式也不同,检测器必须持续更新才能跟得上这些新模型生成内容,加之需求很少,现在真的没有很多好的检测器了。只有少数的小公司还在开发,把这个做成一个商业服务。

LLM检测器可以是一个切入点,但是用于字幕的话还有一个问题,一些检测器依赖的特征维度包括标点,字幕没有标点,这会降低识别率。

---

还有一种检测方式是对比原文是否有超出原文的内容,比如原文写了X,但是看了画面才能翻译出Y,这种逐字逐句翻译得不到Y也是一种检测方式,可能是更适合字幕LLM检测,但是抵挡不了LLM翻译后人工润色。

此外我(小p)前几天在研究LLM翻译,我发现只要提供足够多信息让LLM去翻译字幕,也具备这种超出字面的感知和翻译能力,我称之为“超文本”感知能力,估计这办法也不是长久之计。

比如下方我测试的《后室》让LLM去翻译,看到这些后我是后背发凉的感觉,这些是整个字幕上下文里都没有的信息,完全是自己推理出来的,并且和画面对应上了。

“照片”按照原文翻译不该存在,但是是对的。

1065
01:39:29,120 --> 01:39:31,090
照片上这个男人 是你要找的人吗
Is this man right here the man you were looking for?

“响啊”按照原文翻译也不该存在,LLM正确识别为对讲机,然后翻译成“响啊”。

8
00:02:57,350 --> 00:03:00,160
响啊 响啊 响啊
Work. Work. Work.
Jack
试过了,GPT 5.6会把大量原创翻译判断为不标准翻译

寻找遗失的人人
衣柜军团龙家族应该算原创翻译的

AI_Srt
其实现在的官方译本基本都是基于 AI 翻译的

Dex7er
字幕组终结者已经站在门口敲门了...

最新評論
@Jack:我记得22年、23年刚出LLM的时候,很多学校是严禁使用LLM写论文的,那时候有很多开源的检测器项目,可以检测一段文本是不是LLM写的,或者LLM润色的,后来发现LLM大家都在用,利大于弊,也就放开了。 这些检测器对于英文内容识别率是比较高的,对于中文识别率很低,因为中文语法结构下很难找到那种LLM修改、创建后明显的统计模式。 所以LLM检测器在中文里实际上一直没有发展起来。 这是我找到的几个中文检测器项目,你可以看下: https://github.com/free-revalution/AIGC-Detector-Pro https://github.com/zejunwang1/GPTDetector 还有就是随着模型的不同,生成的语气、模式也不同,检测器必须持续更新才能跟得上这些新模型生成内容,加之需求很少,现在真的没有很多好的检测器了。只有少数的小公司还在开发,把这个做成一个商业服务。 LLM检测器可以是一个切入点,但是用于字幕的话还有一个问题,一些检测器依赖的特征维度包括标点,字幕没有标点,这会降低识别率。 --- 还有一种检测方式是对比原文是否有超出原文的内容,比如原文写了X,但是看了画面才能翻译出Y,这种逐字逐句翻译得不到Y也是一种检测方式,可能是更适合字幕LLM检测,但是抵挡不了LLM翻译后人工润色。 此外我(小p)前几天在研究LLM翻译,我发现只要提供足够多信息让LLM去翻译字幕,也具备这种超出字面的感知和翻译能力,我称之为“超文本”感知能力,估计这办法也不是长久之计。 比如下方我测试的《后室》让LLM去翻译,看到这些后我是后背发凉的感觉,这些是整个字幕上下文里都没有的信息,完全是自己推理出来的,并且和画面对应上了。 “照片”按照原文翻译不该存在,但是是对的。 1065 01:39:29,120 --> 01:39:31,090 照片上这个男人 是你要找的人吗 Is this man right here the man you were looking for? “响啊”按照原文翻译也不该存在,LLM正确识别为对讲机,然后翻译成“响啊”。 8 00:02:57,350 --> 00:03:00,160 响啊 响啊 响啊 Work. Work. Work. - 蒙太奇字幕组