AI Text Watermark: ChatGPT ਯੂਜ਼ਰਾਂ ਲਈ ਆਉਣ ਵਾਲੇ ਸਮੇਂ ਵਿੱਚ AI ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਟੈਕਸਟ ਦੀ ਪਛਾਣ ਕਰਨਾ ਹੋਰ ਆਸਾਨ ਹੋ ਸਕਦਾ ਹੈ। OpenAI ਨੇ ‘textGrain’ ਨਾਮ ਦੀ ਇੱਕ ਨਵੀਂ ਅਦਿੱਖ ਟੈਕਸਟ ਵਾਟਰਮਾਰਕਿੰਗ ਤਕਨੀਕ ਤਿਆਰ ਕੀਤੀ ਹੈ। ਇਸ ਤਕਨੀਕ ਰਾਹੀਂ AI ਵੱਲੋਂ ਤਿਆਰ ਕੀਤੇ ਟੈਕਸਟ ਵਿੱਚ ਅਜਿਹਾ ਅੰਕੜਾਤਮਕ ਸਿਗਨਲ ਬਣਾਇਆ ਜਾਂਦਾ ਹੈ, ਜੋ ਆਮ ਯੂਜ਼ਰ ਨੂੰ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦਾ ਪਰ ਖਾਸ ਡਿਟੈਕਸ਼ਨ ਸਿਸਟਮ ਇਸ ਦੀ ਪਛਾਣ ਕਰ ਸਕਦਾ ਹੈ।
ਕੀ ਹੈ OpenAI ਦਾ ‘textGrain’?
‘textGrain’ ਇੱਕ Invisible Watermarking System ਹੈ। ਇਸ ਵਿੱਚ ਟੈਕਸਟ ਦੇ ਅੰਦਰ ਕੋਈ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਨਿਸ਼ਾਨ, ਵਾਧੂ ਸਪੇਸ ਜਾਂ ਲੁਕਿਆ ਹੋਇਆ ਕੈਰੇਕਟਰ ਨਹੀਂ ਜੋੜਿਆ ਜਾਂਦਾ।ਇਸ ਦੀ ਬਜਾਏ AI ਮਾਡਲ ਵੱਲੋਂ ਸ਼ਬਦਾਂ ਦੀ ਚੋਣ ਕਰਨ ਦੇ ਤਰੀਕੇ ਵਿੱਚ ਬਹੁਤ ਛੋਟੇ ਅੰਕੜਾਤਮਕ ਬਦਲਾਅ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਜਦੋਂ ਇਹ ਪੈਟਰਨ ਵੱਡੇ ਟੈਕਸਟ ਵਿੱਚ ਇਕੱਠੇ ਹੁੰਦੇ ਹਨ ਤਾਂ ਇੱਕ ਖਾਸ ਸਿਗਨਲ ਬਣਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਖਾਸ ਡਿਟੈਕਸ਼ਨ ਟੂਲ ਰਾਹੀਂ ਪਛਾਣਿਆ ਜਾ ਸਕਦਾ ਹੈ।
ਕਾਪੀ-ਪੇਸਟ ਕਰਨ ਨਾਲ ਨਹੀਂ ਹਟੇਗਾ ਵਾਟਰਮਾਰਕ
‘textGrain’ ਦੀ ਖਾਸ ਗੱਲ ਇਹ ਹੈ ਕਿ ਵਾਟਰਮਾਰਕ ਕਿਸੇ hidden character ਜਾਂ ਵੱਖਰੇ token ਦੇ ਰੂਪ ਵਿੱਚ ਨਹੀਂ ਹੁੰਦਾ। ਇਹ ਟੈਕਸਟ ਵਿੱਚ ਸ਼ਬਦਾਂ ਦੀ ਚੋਣ ਨਾਲ ਜੁੜੇ ਅੰਕੜਾਤਮਕ ਪੈਟਰਨ ਦਾ ਹਿੱਸਾ ਹੁੰਦਾ ਹੈ।ਇਸ ਲਈ ਸਿਰਫ਼ ChatGPT ਤੋਂ ਟੈਕਸਟ ਕਾਪੀ-ਪੇਸਟ ਕਰਨ ਨਾਲ ਇਹ ਸਿਗਨਲ ਆਪਣੇ ਆਪ ਖਤਮ ਨਹੀਂ ਹੁੰਦਾ। ਹਾਲਾਂਕਿ ਟੈਕਸਟ ਵਿੱਚ ਵੱਡੇ ਪੱਧਰ ’ਤੇ ਬਦਲਾਅ, ਦੁਬਾਰਾ ਲਿਖਣਾ ਜਾਂ ਕਿਸੇ ਹੋਰ ਭਾਸ਼ਾ ਵਿੱਚ ਅਨੁਵਾਦ ਕਰਨਾ watermark detection ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦਾ ਹੈ।
ਕੀ ਇਸ ਨਾਲ ਯੂਜ਼ਰ ਦੀ ਪਛਾਣ ਹੋਵੇਗੀ?
ਨਹੀਂ। ਇਸ ਤਕਨੀਕ ਦਾ ਮਕਸਦ ਯੂਜ਼ਰ ਦੀ ਪਛਾਣ ਕਰਨਾ ਨਹੀਂ ਹੈ।
ਜੇਕਰ ਕਿਸੇ ਟੈਕਸਟ ਵਿੱਚ watermark signal ਮਿਲਦਾ ਹੈ ਤਾਂ ਇਸ ਤੋਂ ਇਹ ਪਤਾ ਨਹੀਂ ਲੱਗਦਾ ਕਿ:
- ਟੈਕਸਟ ਕਿਸ ਯੂਜ਼ਰ ਨੇ ਤਿਆਰ ਕੀਤਾ।
- ਕਿਹੜਾ prompt ਵਰਤਿਆ ਗਿਆ
- ਟੈਕਸਟ ਕਿਸ ChatGPT conversation ਤੋਂ ਆਇਆ।
- ਟੈਕਸਟ ਵਿੱਚ ਇਨਸਾਨ ਦਾ ਕਿੰਨਾ ਯੋਗਦਾਨ ਹੈ।
- ਅੰਤਿਮ ਟੈਕਸਟ ਦਾ ਮਾਲਕ ਕੌਣ ਹੈ।
ਇਸ ਲਈ watermark detection ਨੂੰ AI-generated content ਦੀ ਪਛਾਣ ਦਾ ਇੱਕ ਸੰਕੇਤ ਸਮਝਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਨਾ ਕਿ ਯੂਜ਼ਰ ਦੀ ਪਛਾਣ ਦਾ ਸਾਧਨ।
ਹਰ AI ਟੈਕਸਟ ਦੀ ਪਛਾਣ ਹੋਣਾ ਜ਼ਰੂਰੀ ਨਹੀਂ
ਇਹ ਤਕਨੀਕ 100 ਫੀਸਦੀ ਸਹੀ AI detector ਨਹੀਂ ਹੈ। ਟੈਕਸਟ ਦੀ ਲੰਬਾਈ, ਭਾਸ਼ਾ, ਵਿਸ਼ਾ ਅਤੇ ਬਾਅਦ ਵਿੱਚ ਕੀਤੀ ਗਈ ਐਡਿਟਿੰਗ ਇਸ ਦੀ detection ਸਮਰੱਥਾ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦੀ ਹੈ।ਖਾਸ ਕਰਕੇ ਬਹੁਤ ਛੋਟੇ ਟੈਕਸਟ ਜਾਂ ਅਜਿਹੇ ਜਵਾਬ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਸ਼ਬਦਾਂ ਦੀ ਚੋਣ ਦੀ ਗੁੰਜਾਇਸ਼ ਘੱਟ ਹੁੰਦੀ ਹੈ, ਉਨ੍ਹਾਂ ਵਿੱਚ watermark signal ਨੂੰ ਪਛਾਣਨਾ ਮੁਸ਼ਕਲ ਹੋ ਸਕਦਾ ਹੈ।ਇਸੇ ਤਰ੍ਹਾਂ ਜੇ AI ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਟੈਕਸਟ ਵਿੱਚ ਬਾਅਦ ਵਿੱਚ ਕਾਫ਼ੀ ਸ਼ਬਦ ਬਦਲ ਦਿੱਤੇ ਜਾਣ ਜਾਂ ਉਸ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖਿਆ ਜਾਵੇ ਤਾਂ detection ਦੀ ਸੰਭਾਵਨਾ ਵੀ ਘਟ ਸਕਦੀ ਹੈ।
ਗਣਿਤ ਵਰਗੇ ਵਿਸ਼ਿਆਂ ਵਿੱਚ ਚੁਣੌਤੀ
ਗਣਿਤ ਅਤੇ ਹੋਰ constrained content ਵਿੱਚ AI ਵੱਲੋਂ ਸ਼ਬਦਾਂ ਦੀ ਚੋਣ ਲਈ ਵਿਕਲਪ ਘੱਟ ਹੁੰਦੇ ਹਨ। ਇਸ ਕਾਰਨ ਅੰਕੜਾਤਮਕ watermark signal ਬਣਾਉਣਾ ਅਤੇ ਉਸ ਦੀ ਪਛਾਣ ਕਰਨਾ ਆਮ ਲਿਖਤੀ ਟੈਕਸਟ ਦੇ ਮੁਕਾਬਲੇ ਔਖਾ ਹੋ ਸਕਦਾ ਹੈ।ਇਸ ਲਈ watermark ਨਾ ਮਿਲਣ ਦਾ ਇਹ ਮਤਲਬ ਨਹੀਂ ਕਿ ਕੋਈ ਟੈਕਸਟ ਲਾਜ਼ਮੀ ਤੌਰ ’ਤੇ ਇਨਸਾਨ ਨੇ ਹੀ ਲਿਖਿਆ ਹੈ।
ਫਿਲਹਾਲ ਆਮ ਲੋਕਾਂ ਲਈ ਨਹੀਂ ਹੈ detector
OpenAI ਵੱਲੋਂ ਇਸ ਤਰ੍ਹਾਂ ਦੀ text verification technology ਦੀ ਪਹੁੰਚ ਫਿਲਹਾਲ ਆਮ ਯੂਜ਼ਰਾਂ ਲਈ ਖੁੱਲ੍ਹੀ ਨਹੀਂ ਕੀਤੀ ਗਈ ਹੈ। ਖੋਜਕਰਤਾਵਾਂ ਅਤੇ ਮਾਹਿਰ ਸੰਸਥਾਵਾਂ ਲਈ ਇਸ ਦੀ ਪਹੁੰਚ ਨੂੰ case-by-case ਆਧਾਰ ’ਤੇ ਦਿੱਤਾ ਜਾ ਸਕਦਾ ਹੈ।ਇਸ ਦਾ ਇੱਕ ਵੱਡਾ ਕਾਰਨ false positive ਅਤੇ false negative ਦਾ ਖਤਰਾ ਹੈ। ਕਿਸੇ ਇਨਸਾਨ ਵੱਲੋਂ ਲਿਖੇ ਟੈਕਸਟ ਨੂੰ ਗਲਤੀ ਨਾਲ AI-generated ਦੱਸਣਾ ਜਾਂ AI ਟੈਕਸਟ ਨੂੰ ਪਛਾਣ ਨਾ ਪਾਉਣਾ—ਦੋਵੇਂ ਸਥਿਤੀਆਂ ਸੰਭਵ ਹਨ।
EU ਵਿੱਚ AI Content Transparency ਵੱਲ ਵੱਡਾ ਕਦਮ
OpenAI ਵੱਲੋਂ AI-generated content ਦੀ provenance ਅਤੇ transparency ਨੂੰ ਲੈ ਕੇ watermarking ਵਰਗੀਆਂ ਤਕਨੀਕਾਂ ’ਤੇ ਕੰਮ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ। ਇਸ ਦਾ ਮੁੱਖ ਮਕਸਦ ਲੋਕਾਂ ਅਤੇ ਸੰਸਥਾਵਾਂ ਨੂੰ ਇਹ ਸਮਝਣ ਵਿੱਚ ਮਦਦ ਕਰਨਾ ਹੈ ਕਿ ਕੋਈ content AI ਸਿਸਟਮ ਤੋਂ ਤਿਆਰ ਹੋਇਆ ਹੈ ਜਾਂ ਨਹੀਂ।
