Жасанды интеллект сенімді ме?

Жасанды интеллект сенімді ме? [Бейне және викторина]

Қысқа жауап: Жасанды интеллект қасиет ретінде сенімді емес: ол тапсырмаға, іздеу цикліне және әлі де ілмектегі адамға. Жұмыс уақыты - соңғы нүктеге жауап берілген бе; шыншылдық - жауаптың солай болған ба. Қате арзан немесе ұстауға болатын кезде қолданыңыз; қате қымбат болған кезде баяулаңыз.

Негізгі қорытындылар:

Есеп беру: Кім тексеріп жатқанын, кім тоқтата алатынын және кімнің кінәлі екенін атаңыз.

Мөлдірлік: Алынған бөлікті тексеріңіз, әйтпесе сіз әлі де тұманда боласыз.

Аудит мүмкіндігі: Қателіктерді бақылау үшін шақыруларды, алынған бөліктерді және жіберілімдерді тіркеу.

Дұрыс пайдаланбауға қарсылық: Ақша мәселелері бойынша сәтсіздікке ұшыраңыз; ешқашан сандарды, терезелерді немесе саясатты ойлап таппаңыз.

Көрнекі нәтижелер: 20 сұрақтан тұратын көрнекі тестті 95% дәлел ретінде емес, карта ретінде қарастырыңыз.

Жасанды интеллект сенімді ме? Инфографика

Осыдан кейін оқуға болатын мақалалар:

🔗 Күнделікті өмірде жасанды интеллектті қалай пайдалануға болады
Жасанды интеллекттің күнделікті тапсырмалар мен тәртіптерді жеңілдетудің практикалық жолдарын ашыңыз.

🔗 Жұмыста жасанды интеллектті қалай пайдалану керек
Жасанды интеллект көмегімен өнімділік пен тиімділікті арттырудың практикалық жолдарын үйреніңіз.

🔗 Жасанды интеллект өздігінен ойлай ала ма?
Жасанды интеллект шынымен тәуелсіз ойлай және ойлай ала ма, жоқ па, соны зерттеңіз.

🔗 Жасанды интеллекттің қандай түрлері бар?
Жасанды интеллекттің негізгі түрлерін, мүмкіндіктерін және негізгі айырмашылықтарын түсініңіз.

Машина статистикалық тотықұс болған кезде «сенімді» деген нені білдіреді

Күнделікті сөйлеуде сенімділік дегеніміз бір нәрсеге сүйенуге болатындығын білдіреді.

Автоматтандыру сөйлейтіндіктен, әртүрлі қасиеттердің үйіндісі бір сөздің астында жасырылады. Нақтылық. Тұрақтылық. Калибрлеу - модельдің сенімділігі оның дұрыс болу мүмкіндігіне сәйкес келе ме, әлде ол жай ғана... сенімді естіледі ме. Қауіпсіздік. Жұмыс уақыты. Жедел сезімталдық. Шеткі жағдайлардағы мінез-құлық. Тірі әлем оқыту әлемі болмаған кезде. Олардың ешқайсысы бірге сәтсіздікке ұшырамайды. Бұл адамдар жіберіп алатын нәрсе.

Чатбот апта бойы «қозғалмай» жұмыс істей алады, ал сейсенбі күні түстен кейін қателесуі мүмкін. Код жазушының екінші пилоты қарапайым түрде жақсы жұмыс істей алады, содан кейін түпнұсқаға ұқсас API-ны галлюцинациялай алады. Адамдардың ұмтылатын метафорасы - «кіші әріптес». Бұл жетілмеген метафора - кішілер ұялады - бірақ ол «оракулдан» жақынырақ.

Тікелей эфирдегі тест не үшін, кім үшін, қай циклмен жұмыс істейтініне сенімді. Әйтпесе, сіз блендерді салық төлей алатындығына қарай бағалайсыз.

Жұмыс уақыты шыншылдық емес - екі түрлі «сенімді»

Опс-адамдар мен шындықты айтатындар бір сөзді қолданады және бір-бірімен сөйлеседі.

Жұмыс уақыты - «соңғы нүктеге жауап берді». Шындық - «жауап солай болды». Басқару екеуіне де қамқорлық жасайды, ал модельдік тәуекел жағымсыз алшақтықта жатыр. Сізде ешқашан жыпылықтамайтын және тұтынушы билетіне еркін өтірік жіберетін қызмет болуы мүмкін. SRE мағынасында сенімді. «Қайтару саясатын ойлап таппаңыз» мағынасында сенімді емес.

Меніңше, бұл жазылғандай айқын. Сағат 16:00-де жауап жылдам және кезек құбыжық болған кезде бұл айқын емес. Жылдамдық біліктілік сияқты сезіледі. Баяулық бұрын біреудің ойлап тұрғанын білдіретін. Енді жылдамдық ешкімнің ойланбай отырғанының белгісі.

Қауіпсіздік – тағы бір маңызды мәселе. Жағымсыз джейлбрейктен бас тартатын модель қауіпсіздікті бағалау тұрғысынан «сенімді» және сіздің жазбаларыңыздың қысқаша мазмұнын бұрмалауы мүмкін.

Шебер және қателескен сөз ебедейсіз және ашық сөйлеуден де жаман

Бұл сенімділік мәселесі, және ол ең басты мәселе.

Дәлдік пен еркін сөйлеу ажыратылды, ал еркін сөйлеу шеберлігі үйді сақтап қалды. LLM сізге ырғақ, дұрыс орындарды анықтау, мүмкін жалған, бірақ әдемі дәйексөз формасын береді. Миыңыз «бұл адам біледі» деп оқиды. Бірақ бұл адам емес, және калибрлеу көбінесе қорқынышты - жоғары сенімділік, орташа шындық, негізгі баяндама сияқты жеткізіледі.

Елеусіз қате жауап сізді күдіктендіреді. Жай сөйлейтін қате жауап тексеруді тоқтатуға мәжбүр етеді. Бұл үлкен айырмашылық емес; бұл бүкіл оқиғаны бір ғана жағымсыз сөйлеммен баяндайды.

Мұнда да біржақтылық бар, әрқашан мазақ ретінде емес, бөлмеде кім бар және ағылшын тілінің қай дәмі бейтарап деп саналатыны туралы әдепкі мән ретінде. Адамдар алданып қалады, себебі тіл біздің ең көне сенім интерфейсіміз. Егер ол қысқаша мазмұндама сияқты айтылса, біз оны қысқаша мазмұндама ретінде қарастырамыз. Мен бұған цинизммен қарағым келеді. Содан кейін мен түсініксіз қысқаша мазмұндаманы оқыдым, бірақ иығым түсіп кетті. Кездесуге кіргенде, қысқаша мазмұндама аяқталған сияқты. Бұл сөйлем тым көп жұмыс істейді, бірақ сонда да: ханым осылайша пікірталасқа түседі.

Брендке емес, жағдайға байланысты сенімділік

Брендтер – алаңдататын нәрсе. Ең бастысы – салыстыру. Даулар бір-бірімен дауласады. Бұл қалыпты жағдай.

Қолдану жағдайы Қалайша сәтсіздікке ұшырайды «Жақсы» болған кезде Адамның әлі не істеуі керек Неліктен адамдар алданады
Жобалау / қорытындылау Ерекшелікті алып тастайды; мүмкін жаңартуларды міндетті түрде жаңартуға мүмкіндік береді Сіз білетін алғашқы мәтін Атауларды, сандарды, ауыртатын жолды тексеріңіз Сізге ұқсайды. Жіберіңіз.
Іздеу стиліндегі сұрақ-жауап Тұманға қарсы жауаптар; сәтсіз аяқталуға жақын іздеу факт ретінде жазылды Бағыт, соңғы сөз емес Дереккөзді ашыңыз, әйтпесе сізде тек болжам бар Алынған және ойлап табылған сөздер үшін бірдей дыбыс
Код бойынша көмек Ойлап табылған API; қатені растайтын тесттер Қалыпты тақтайша, желім, «бұл қатені түсіндіріңіз» Оны іске қосыңыз. Айырмашылығын оқыңыз. (Уағыздау сөзі, кешіріңіз.) Үй стилі. Жасыл көрінетін сынақтар.
Тұтынушыларды қолдау Ойлап табылған саясат; сыпайы қате жоқ Қатаң саясат шеңберіндегі жобалар Ақша мен сенімге иелік етіңіз Жылдам + мейірімді. Бесінші хабарламаны ешкім тексермейді.
Медициналық/заңгерлік кеңес Еркін сөйлеген, құрылымдалған, апатты түрде сенімді Өнім ретінде ешқашан дерлік емес Кәсіби болыңыз. Модель - бұл ақымақтық. Егер бұл дөрекі естілсе, жақсы. Қысқаша әңгіме сияқты.
Бағалау / рейтинг Прокси мүмкіндіктері; дрейф; шетіне батқан корпустар Сіз қайта жазатын сұрыптау Құйрықты дәл тексеріңіз Сандар есейгендей сезіледі. Басқару тақталары басқару сияқты сезіледі. Олар өздігінен емес.
Кескін жасау Қолдар, артық шынтақтар, стереотиптік қалдықтар Көңіл-күйді көтеретін тақталар, кездейсоқ қойылатын сұрақтар - дәлел емес Екі рет қараңыз, мағынасы тек артефактілер ғана емес Претти күмәншіл бөлігін жауып тастайды
Автономды агенттер Сенімді құрал шақыруы; күрделі қателер Кідірту қосқышы бар тар ілмектер Ілгекте тұрыңыз. Ол тиіп кете алатын нәрсені жабыңыз. Нөмірленген жоспар құзыреттілікке ұқсайды. Көбінесе бұл қозғалтқышы бар істер тізімі.

Қалай болғанда да. Егер сіздің сүйікті құралыңыз дойбымен шебер болса және түн ортасында одан заңды жайлылық сұрасаңыз, бұл жаңарту емес. Бұл сіздің оны тастап кеткеніңізді көрсететін карта.

Галлюцинациялар, ауытқу және тыныш қателіктер

Галлюцинация тақырыптарға ілігеді, себебі ол өте өткір: жоқ кітап, ешқашан жеткізілмеген функция, ресми болып көрінетін саны бар саясаттық тармақ.

Дрифт онша кинематографиялық емес. Әлем қозғалады. Модельдің қалдықтары қалады. Сіз жаңа контекст қажет ететін сұрақ қоясыз және алдыңғы ауа райынан жақсы ұйымдастырылған жауап аласыз. Мен онда "басқа дәуірден" деп жаза жаздадым, бұл тақырыптың асыра сілтеушілігі. Бұл басқа дәуір емес. Қазір емес.

Маған көбірек маңыздысы - үнсіз қателік. Ерекшелікті алып тастайтын қысқаша мазмұн. Мүмкін деген сөзді міндетті түрде айтуға болатын қайталау. Мағынасы өзгерген кезде шындық "техникалық тұрғыдан жақсы" болуы мүмкін.

Шұғыл сезімталдық жағдайды одан сайын ушықтырады. Қаптаманы өзгертіңіз, сонда «фактілер» жарқырайды. Күмәншіл ретінде сұраңыз, қоршаулар алыңыз. Асығыс бастық ретінде сұраңыз, шапшаң шағымданыңыз. Егер сіздің бағалауыңызда тек бір костюм қолданылса, сіздің бағалауыңыз аздап өтірік. Кешіріңіз.

Джейлбрейктер шетінде тұр, мен тонау туралы фильм түсіргім келмейді. Егер жүйені өз әдеп-ғұрыптарынан бас тартуға мәжбүрлеуге болатын болса, сенімділік тек шындықта ғана емес; мәселе қоршаулардың цикл немесе плакат болуында.

Жаттығу қалдықтары, ескірген білім және неге жерге қосу сиқырлы таяқша емес

Генеративтік модельдер үйіндіде жаттықтырылады, содан кейін сейсенбіге бағытталады. Қайта алу - бұл ересектердің қазіргі істі сол үйіндіге бекіту әрекеті. Жерге қосу «тұманнан емес, осыдан жауап беру» дегенді білдіреді. Ол сәтсіз болған кезде, сыпайы түрде сәтсіздікке ұшырайды.

Классикалық сәтсіздік: ретривер жіберіп алуға жақын құжатты алады. Генератор оны толық сабырлықпен жазады. Сіз дереккөз пішінді нысанды көресіз және тексеру инстинкті жұмыс істейді. Мен мұны істеймін. Сіз, бәлкім, мұны істейсіз. Дәйексөз идеясы дұрыс; іске асыру тек соққыға жеткенше жақсы.

Ескірген білім – тағы бір ақпараттың ағып кетуі. Кейбір тапсырмалар үшін нақты күй қажет – бағалар, қорлар, саясаттың ағымдағы тұжырымдамасы. Кейбіреулері үшін тұрақты шеберлік қажет, мысалы, меморандумды қалай құру керек. Оларды араластырыңыз, сонда сіз қазірдің өзінде қозғалған әлем туралы өте сенімді жауап аласыз. Тарату ауысымы – ересектердің атауы: нақты тарату – оқыту таратуы емес, ал шеткі жағдайлар олқылықта тұрады.

Тағы бір нәрсе, менің жазбаларым осылай көрінетіндіктен, дұрыс емес дефиспен айтылады: жерге қосу - бұл еден, ал гало емес. Егер сіз алынған бөлікті тексере алмасаңыз, сіз әлі де тұмандасыз, тек жақсы жарықтандырумен.

Бағалау театры: демонстрация неге қорқынышты сынақ болып табылады

Демонстрациялар өте қызықты. Эталондар сәл ашық және бұл сіздің жұмысыңыз емес.

Таза тапсырма және модель мыңдаған туыстарын көрген тапсырма - әрине, ол өткір көрінеді. Сахналық қойылымды өлшейтін бағалау ғана. Тікелей эфирдегі жұмыс процестерінде шатасқан қойылымдар, жоқ файлдар және олардың мазасыздығын азайтатын бірінші жауапты қабылдайтын пайдаланушы бар.

Эталондар маңызды. Олар тек колодалар сияқты жақсы жүрмейді. Лидер тақтасының ұпайы сіздің билеттеріңізді калибрлеу емес. Компаниядағы модель тәуекелі - "бұл көлемде дұрыс емес болғанда не болады" деген сөз, "ол ​​викторина жиынтығынан өтті ме" деген сөз емес. Сізге қажет тесттер құрғақ: алынған үзіндінің ішінде болыңыз; блефтің орнына белгісіздікті белгілеңіз; қайта сөз тіркесін жасаған кезде бірізді болыңыз; ашудан (ойлап табудан) гөрі, жабылудан (бас тарту, сұрау, кейінге қалдыру) бас тартыңыз.

Мен адамдардың бір ғана таңғажайып аяқталуды дәлел ретінде қарастыратынын көрдім. Бұл мейрамхананы бастапқы тағам әдемі болғандықтан «сенімді» деп шешумен бірдей. Мүмкін солай шығар. Мүмкін ас үй он минут бойы жақсы тамақтанған шығар.

Кішкентай қарама-қайшылық пайда болды: Мен әлі де демо нұсқаларын пайдаланып, сезімді сезінемін. Мен тек сезімді пайдаланбаймын.

Жасанды интеллект сенімді ме? Тек біреу әлі де тығырыққа тірелген жағдайда ғана

Адамның циклдегі дизайны - бұл істен шығу режимдеріне сәйкес келетін жалғыз дизайн.

Егер ешкім есеп бермесе, жүйе бұрынғыдай пайдаланылады. Басқару - «кім қарайды, кім тоқтата алады, не тіркеледі, жіберіп алғаннан кейін не болады» дегеннің жағымсыз атауы. Агенттер мұны тек абзацтарды ғана емес, шараларды қабылдайтындықтан өткір етеді. Сіз жібермеген жоба арзан. Сіз айтқыңыз келмеген құралға қоңырау шалу арзан.

Қателескен адамды атаңыз. Егер жауап «модель» болса, сізде жауап жоқ. Модельдер оқиғадан кейін кездесуге бармайды. Бір адам барады немесе шаңсорғыш барады, содан кейін адвокат барады.

Жарылыс радиусына сәйкес келетін тексерулерді таңдаңыз. Әлеуметтік желідегі жазбаға емле деңгейіндегі шолу. Фактіні растайтын кез келген нәрсеге дереккөзді тексеру. Медицина, заң, несие, қауіпсіздікке қатысты маңызды операцияларға қатысты кез келген нәрсеге кәсіби маман. Олар үшін адам «ілмектегі» емес. Адам – бұл ілмек. Модель – бұл бос сөз. Бұл жеке тұлға ретіндегі күмән емес. Бұл – талғам.

Қазіргі уақытта чекті жылтыр жіберу түймесінің артына жасыру сәнге айналды. Қазіргі кезде қауесетті кездейсоқ осылай автоматтандырасыз. Соңғы кездері мен бұған бей-жай қарай бастадым, ал жұмыс жақсарды.

Қателескен адамды табу үшін қалай сұрау керек

Сіз бұл жүйелерді күн сәулесіне күмәнданбай-ақ тексере аласыз.

  • Белгісіздікті әдейі сұраңыз. «Мұны не дұрыс істемейді?» деген сұрақ «сенімді ету» деген сұрақтан гөрі маңыздырақ.

  • Мүмкіндігінше, деректерді ұрпақтан ұрпаққа бөліңіз. Алдымен үзінділерді қараңыз. Содан кейін мазмұнын сұраңыз.

  • Костюмді ауыстырыңыз. Қайта сөйлеңіз. Оған керісінше дәлелдеуді сұраңыз. Егер сіз оны осылай қолдансаңыз, жедел сезімталдық - бұл фонарь.

  • Мәжбүрлеу шектеулері: "тек қойылған мәтіннен", "егер жоқ болса, жоқ деп айтыңыз". Модельдер таңқаларлықтай бағынады... олар жоқ болғанша. Қалай болғанда да тексеріңіз.

  • Тексеруші бар тапсырмаларды қалаймын. Компиляторлар, линтерлер, схемаларды тексеру, екінші көз. Сенімділік бағалаушыны жақсы көреді.

  • Нақтырақ айтқанда, айқындыққа назар аударыңыз. Нақты көрінетін дене пішіні, аты аталған жағдай, реттелген нөмірленген сөйлем – галлюцинация осылайша өзін көрсеткісі келеді.

  • Адамның қадамын көрінетіндей етіп сақтаңыз. Егер пайдаланушы интерфейсі чекті жасырса, адамдар чекті өткізіп жібереді. Бұл жиһаз, моральдық кемшілік емес.

Мұның ешқайсысы модельді «шын» етпейді. Бұл циклді онша сенімді етпейді. Менің ойымша, бұл нәтиже.

Карта сізді қайда қалдырады

Сонымен. Иә/жоқ сұрағы тек есік ретінде ғана жұмыс істейді.

Жасанды интеллект сенімді ме? Қасиет ретінде емес. Тапсырманың, деректер жиынтығының, іздеу циклінің, демо емес бағалаудың және әлі де мағынасын түсінуге мәжбүр адам ретінде. Шеберлік бізді алдай береді, себебі біз тілдік жануарлармыз, ал бұл жүйелер тілдік машиналар. Жұмыс уақыты шындықпен шатастырыла береді, себебі екеуі де «жұмыс істеді» деп сезінеді. Екінші ұшқыштар шатасып қалған ортада өздерін таба береді - жобалар, шолып шығуға болатын қысқаша мазмұндар, құрастыруға болатын код - және біз шешім қабылдауды маңызды емес абзацқа берген кезде қауіпсіз емес.

Оларды сәтсіздік арзан немесе ұстауға болатын жерде қолданыңыз. Сәтсіздік қымбат жерде баяулаңыз. Бұл тікелей жауап, және ол ұраннан да құнды.

Егер сіз бір нәрсені алсаңыз: модельден сенімді ме деп сұрауды тоқтатыңыз. Оның қалай қате болуы мүмкін екенін сұрағанда не болатынын бақылаңыз. Содан кейін тексеріп көріңіз.

Нақты әлемдегі мысал: мүшелік саясаты бар жасанды интеллект көмекшісін құру

Сценарий

Прия тәуелсіз спорт залдарына арналған Ұлыбританияның 70 адамнан тұратын сауда органы Harbour Membership үшін білімді басқарады. Мүшелердің сұрақтарына үш адам жауап береді. Шындықтың көзі - әр тоқсан сайын жаңартылып отыратын 180 беттік нұсқаулық, сонымен қатар ешкімнің жоюға батылы бармайтын ортақ дискідегі ескі PDF файлдары.

Басшылық анықтама қызметінің екінші пилотын сатып алды. Демо нұсқасы өте жақсы болды. Жұмыс уақыты жақсы болды. Екінші аптада еркін жазылған жоба мүшеге 14 күнге қатып, «стандартты түрде» толық ақшаны қайтарып алуға болатынын айтады. Бұл саясат емес. Агент мұны түсінді, себебі ақша мәселесі туындаған кезде олар әлі де нұсқаулықты ашады. Басшылықтың «иә» немесе «жоқ» деген сияқты жіберілген сұрағы: жасанды интеллект сенімді ме?

Прия үкімнен бас тартады. Ол оны карта ретінде қарастырады. Жұмыс «мүшелерге оракул беру» емес. Бұл «қазіргі нұсқаулықтан жауап жазу, үзіндіні көрсету және үзінді жоқ болған кезде қатені жабу». Егер екінші пилот мұны істей алмаса, бұл саясат үстелі емес, жобалау ойыншығы.

Көмекшіге не қажет

  • 2026 жылғы сәуірдегі нұсқаулық жалғыз рұқсат етілген корпус ретінде, бөлім нөмірлері өзгеріссіз қалдырылған

  • Ескі 2023 жылғы PDF файлы дискіде әдейі қалдырылған, сондықтан олар іздеу сәтсіз аяқталуға жақын тұрған нәрсенің табыла ма, жоқ па, соны көре алады

  • Жазбаша ереже: тұтынушы құралдарына тұтынушының жеке деректері кірмейді; адамсыз жіберуге болмайды; сандарды, терезелерді немесе «стандартты» тармақтарды ойлап табуға болмайды

  • Сұрауларды, алынған бөліктерді және соңғы жіберуді тіркеуге рұқсат

  • Тест сетінен жоғары балл жинап, екінші пилотты тоқтататын атаулы иесі (Прия) ақша сұрақтарына тиын лақтырудан да жаман аяқталады

  • Егер құрал қалпына келтіруді қолдаса, алынған бөлік жобаның жанында көрінуі керек. Егер олай болмаса, олар бөлімді қолмен жабыстырады. Тексерілетін өтпе жоқ жерге қосу әлі де тұман болып табылады.

Мысал нұсқаулығы

Прия мұны сахналық қойылымның шақыруымен емес, қарапайым тілмен айтады:

Сізге берілген 2026 жылғы сәуір айындағы нұсқаулық үзінділерінен ғана жауап беріңіз. Бөлім нөмірін көрсетіңіз. Егер жауап сол үзінділерде болмаса, «қазіргі нұсқаулықта жоқ» деп айтыңыз да, тоқтаңыз. Терезелерді қатыруды, ақшаны қайтару ережелерін немесе төлемдерді ойлап таппаңыз. «Спортзалдың қалауы бойынша» дегенді «стандартты» деп өзгертпеңіз. Егер екі үзінді сәйкес келмесе, екеуін де көрсетіп, қайсысы қазіргі екенін айтыңыз. Сіз мүшеге бірдеңе тигенге дейін дереккөзді ашатын адамға арналған жоба жасап жатырсыз.

Содан кейін ол өзіне екінші нұсқаулықты сақтайды, себебі мақаланың мәні модель емес, циклде:

Жібермес бұрын, дәйексөз келтірілген бөлімді ашыңыз. «Мұны не дұрыс істемейді?» деп сұраңыз. Егер жобада үзіндіде жоқ сан болса, оны қабылдамаңыз. Егер мен асығыс бастық сияқты сұрасам, күмәншіл сияқты қайта сұрап, салыстырыңыз.

Жақсы жоба былай көрінеді: «Қазіргі нұсқаулықта жоқ (2026 жылғы сәуір, 4.2-бөлім). Қатыру спортзалдың қалауы бойынша. Қайтару автоматты түрде жүзеге асырылмайды. Күшейту». Нашар жоба былай көрінеді: «Мүшелер 14 күн бойы қатып қалуы мүмкін және стандартты түрде толық ақшаны қайтарып алуы мүмкін. Нұсқаулықта расталған». Сол үн. Олардың тек біреуі ғана саясат болып табылады.

Оны қалай тексеруге болады

Прия кез келген екінші пилоттың нәтижесін қарамас бұрын 20 сұрақ жазады. Бұл рет маңызды. Демо - жарықтандыру. Бұл құрғақ сынақ.

Бұл жиынтық викторина емес. Бұл тікелей эфирдегі қойылым:

  • Жауаптары бір ағымдағы бөлімде орналасқан сегіз сұрақ (оңай сұрақтар)

  • Төрт сәтсіздікке ұшырауға жақын жағдай, мұндағы 2023 жылғы PDF сәуір айындағы мәтінге қарағанда сөздік жағынан жақынырақ

  • «Нұсқаулықта жоқ» деген үш сұрақ (есеп айырысу бойынша даулар, медициналық тұрғыдан байланысты «бұл оқу қауіпсіз бе?», заңды тұрғыдан байланысты келісімшартқа түзету)

  • Ақшаға қатысты үш сұрақ (тоқтату, қайтару, қосылу ақысы)

  • Қатардағы мүшелерге қойылатын екі сұрақ (жұмыс уақыты, жаттықтырушының сақтандыруы)

Сол жиырма адамның екеуі екінші костюм киіп, бір рет асығыс бастық ретінде, ал екінші рет күмәншіл ретінде, жедел сезімталдықты тексеру үшін қайта сұралды. Бұл қайта сұраулар 20 тармақтан тұратын ұпайға қосылмай, тіркелді.

Прияның анықтамалық ашық тұрған кезде бағалаған рубрикасы: өту дұрыс ағымдағы ережені, нақты бөлім нөмірін және қосымша ойлап табылған сөйлемді қажет етпейді. Тыныш сәтсіздік - ерекшелікті алып тастаған немесе мүмкін дегенді міндетті түрде өзгерткен техникалық тұрғыдан жақсы сөйлем. Ашық сәтсіздік - ойлап табылған сан немесе ағымдағы деп саналатын қатеге жақын PDF. Жұмыс уақыты бөлек есептеледі, себебі "жауап берді" деген "солай болды" дегенді білдірмейді.

Әрі қарай баруға келісу: ақша мәселелері бойынша, сәтсіздікті ашудың орнына жабу керек. Егер екінші пилот қайтару терезесін ойлап тапса, ол тікелей билеттерді жобаламайды. Егер ешкім бастапқы кодты ашпаса, ол тікелей билеттерді де жобаламайды.

Нәтиже

Жарияланған Харбор мүшелігінің көрсеткіші емес, ойдан шығарылған 20 сұрақтан тұратын тесттің көрнекі нәтижесі.

Болжамдар: бір анықтама қызметінің екінші пилоты; 2026 жылғы сәуір айындағы нұсқаулық және қалған 2023 жылғы PDF нұсқасы; Прия жоғарыдағы бағаға сәйкес ұпай жинады; уақыт "Мен мұны жіберер едім" дегенге қойылған сұрақтан алынған телефон секундомері болды; шолу уақыты циклдік шартқа қосылады және белгіленбеген шартқа әдейі алынып тасталады, сондықтан салыстыру біркелкі болады.

Тексерілмеген екінші пилот, демо стиліндегі сұрақ: 20 сұрақтың 20-сына еркін жауап берілді (жұмыс уақыты мінсіз көрінді). 20 сұрақтың 11-і критерийге сай келді. Бесеуі үнсіз сәтсіздіктер болды. Төртеуі ашық сәтсіздіктер болды, оның ішінде 14 күндік қатып қалу болды. Төрт ашық сәтсіздіктің екеуінде 2023 жылғы PDF файлынан алынған дереккөз пішінді үзінді келтірілген. Жіберілетіндей көрінетін жобаға дейінгі орташа уақыт 1 минут болды.

Сол 20 сұрақ, шектеулі нұсқаулық, алынған бөлігі көрініп тұр: 20 сұрақтың 15-і сәуір айындағы мәтіннен толығымен дұрыс болды. Үшеуінде «қазіргі нұсқаулықта жоқ» деп дұрыс жазылған (медициналық және заңдық мәселелер бойынша мәселелер, сонымен қатар бір төлем туралы дау), сондықтан 20 сұрақтың 18-і қабылданды. Екеуі әлі де сәтсіз болды: біреуі 2023 жылғы PDF құжатын жазып, екіншісі үзіндіде жоқ қосылу ақысы санын ойлап тапты. Жобаны жасауға орташа уақыт әлі де шамамен 1 минут болды.

Сол 20, сонымен қатар Прия сілтеме жасалған бөлімді имитацияланған жіберуден бұрын ашты: 20-дан 19-ы қабылданар еді. Ол жіберіп алуға жақын PDF файлын тапты. Қалған жіберіп алу себебі шолушының еркін абзацты қарап шығып, ойлап табылған қосылу ақысы санын байқамауы болды. Шолуды қоса алғанда, орташа уақыт 3 минутты құрады.

Ескі процесс, тек нұсқаулық бойынша іздеу, екінші пилотсыз: 20-дан 20-сы қабылданады. Орташа 9 минут.

Бұл үлгі бойынша, циклдік екінші пилот нұсқаулық іздеуден 6 минутқа жылдамырақ (9 минус 3) немесе 20 сұрақ бойынша 120 минутқа жылдамырақ болды, 20 сұрақтың 20-сының орнына 20 сұрақтың 19-ы қабылданды. Тексерілмеген екінші пилот 20 сұрақтың 9-ында 8 минутқа жылдамырақ (9 минус 1) және қате, ақырын немесе қатты айтты. Бұл рульдік басқару жүйесіне салған кезде 67% уақыт үнемдеу емес. Бұл автоматтандырылған 9 қателікпен ағып кету.

Қайталанған екі сұрақтың асығыс басшылық нұсқалары басым болды. Күмәнданушылар бұған қарсы болды. Бір модель, бір нұсқаулық, басқа костюм. Прия мұны жеке тұлға ретінде емес, жаңалық ретінде тіркеді.

Бұл сандар көрсетілген тестке, шағын жиынтыққа, ашулы мүшеге қарағанда оңайырақ билеттерге және кітапты бұрыннан білетін бір шолушыға негізделген мысал ретіндегі бағалау болып табылады. Олар екінші пилоттың «95% сенімді» екенін немесе Харбордың үстел басындағы қызметкерді қысқартуы керек екенін көрсетпейді. Олар жұмыс уақыты мәселе емес, чек мәселе екенін көрсетеді.

Не дұрыс болмауы мүмкін

  • Басшылық 1 минуттық драфт уақытын бағалап, 9 қатені өткізіп жібереді. Сағат 16:00-де жылдамдық әлі де біліктілік сияқты сезіледі.

  • 2023 жылғы PDF файлы индексте қалады. Анықтама алу жұмыстары жалғасуда. Grounding ересек адам сияқты көрінеді және әлі де сәтсіздікке ұшырайды.

  • UI алынған бөлікті жылтыр жіберу түймесінің артына жасырады. Адамдар нұсқаулықты ашуды тоқтатады, осылайша қатыру жауабы мүшеге жетеді.

  • Прия слайдта әдемі көрінетіндіктен, тек сегіз оңай сұраққа ғана жауап береді. Бағалау театры, тек электрондық кесте арқылы.

  • Медициналық тұрғыдан «бұл жаттығу қауіпсіз бе?» деген сұраққа жауап қысқаша жауап сияқты көрінуі мүмкін. Картада «ешқашан» деп жазылған. Ал дыбыста «жалғастыр» деп жазылған.

  • «Артық сезілгендіктен», журналдар өшірілді. Қателіктен кейін ешкім қай үзінді алынғанын көре алмайды.

  • Олар модельден сенімді ме деп сұрайды. Шынымен де солай. Бұл ешқашан сынақ болған емес.

Практикалық қорытынды

Сенімділік - Harbour компаниясын сатып алған екінші ұшқыштың қасиеті емес. Бұл 20 сұрақтан, ағымдағы нұсқаулықтан, көрінетін үзіндіден және ақшаға қатысты дереккөзді ашатын адамнан тұратын қасиет. Сөйлеу шеберлігі жұмыс уақытының сынағынан өтуді жалғастырады. Цикл - саясат сынағынан өтетін жалғыз нәрсе.

Жиі қойылатын сұрақтар

Генеративті жасанды интеллект үшін сенімділік нені білдіреді?

Күнделікті сенімділік дегеніміз - бір нәрсеге сүйенуге болатынын білдіреді. Автоматтандыру сөйлейтіндіктен, қасиеттердің тұтас жиынтығы бір сөздің астында жасырылады: нақтылық, тұрақтылық, калибрлеу, қауіпсіздік, жұмыс уақыты, жедел сезімталдық, шеткі жағдайлар және тарату ауысымынан кейінгі мінез-құлық. Олардың ешқайсысы бірге сәтсіздікке ұшырамайды. Тікелей тест не, кім үшін, қай циклмен айналасында сенімді. Әйтпесе, сіз блендерді салық төлей алатындығына қарай бағалайсыз.

Жасанды интеллект сенімді ме?

Қасиет ретінде емес. LLM бір жұмыста мықты болып, келесі жұмыста үнсіз жұмыс істей алады, кейде бір отырыста, кейде үтірді жылжытқаныңыз үшін. Сенімділік - бұл тапсырманың, деректер жиынтығының, іздеу циклінің, демо емес бағалаудың және әлі де шын жүректен айтуға мәжбүр адамның қасиеті. Оны қате арзан немесе байқауға болатын жерде қолданыңыз. Қате қымбат жерде баяулаңыз.

Жасанды интеллекттің жұмыс уақыты шыншылдықпен бірдей ме?

Жоқ. Жұмыс уақыты - соңғы нүктенің жауап бергені немесе бермегені. Шындық - жауаптың солай болғаны. Сізде ешқашан көзді ашып-жұмғанша өтірік айтатын қызмет болуы мүмкін. Кезек құбыжық болған кезде жылдамдық біліктілік сияқты сезіледі. Қауіпсіздік - тағы бір ось: джейлбрейктен бас тартатын модель сіздің жазбаларыңыздың қысқаша мазмұнын әлі де бұзуы мүмкін.

Неліктен еркін жүретін жасанды интеллект қате болған кезде де сенімді сезінеді?

Дәлдік пен еркін сөйлеу ажырасып кетті, ал еркін сөйлеу үйді сақтап қалды. LLM сізге ырғақ, қорғаныс, мүмкін жалған, бірақ әдемі дәйексөз формасын береді, ал миыңыз «бұл адам біледі» деп оқиды. Калибрлеу көбінесе қорқынышты: жоғары сенімділік, орташа шындық, негізгі баяндама сияқты жеткізіледі. Елеусіз қате жауап сізді күдіктендіреді. Еркін қате жауап тексеруді тоқтатуға мәжбүр етеді. Егер ол қысқаша сөйлейтін болса, біз оны қысқаша жауап ретінде қарастырамыз, және осылайша қателескен адам пікірталасқа түседі.

Медициналық, заңгерлік немесе тұтынушыларды қолдау жұмыстары үшін жасанды интеллект сенімді ме?

Бұл брендке емес, жұмысқа байланысты. Медициналық және заңгерлік кеңестер өнім ретінде ешқашан жеткілікті жақсы бола бермейді: модель - бұл ескірген, ал адам - ​​​​кәсіби маман. Тұтынушыларды қолдау қатаң саясат шеңберінде жоба жасай алады, бірақ ақша мен сенімді жіберу адамда болуы керек, себебі ойлап табылған саясат және сыпайы қате «жоқ» әдеттегідей сәтсіздік болып табылады. Жобалар мен қысқаша мазмұндар - сіз бұрыннан білетін алғашқы мәтін. Аты-жөндерін, нөмірлерін және зиян келтіретін жолды тексеріңіз.

Неліктен жасанды интеллект галлюцинацияланады, ауытқиды немесе жасырын қателеседі?

Галлюцинация – бұл ащы сәтсіздік: жоқ кітап, ешқашан жеткізілмеген функция, ресми болып көрінетін саны бар саясаттық тармақ. Дрифт онша кинематографиялық емес: әлем қозғалады, модельдің қалдықтары қалады және сіз алдыңғы ауа райынан жақсы ұйымдастырылған жауап аласыз. Тыныш қателік – ерекшелікті алып тастайтын қысқаша мазмұн. Немесе «мүмкін» сөзін міндетті түрде қажет ететіндей етіп өзгертетін парафраза. Нақтылық техникалық тұрғыдан жақсы көрінуі мүмкін, ал мағынасы өзгереді. Шұғыл сезімталдық орамды өзгерткен кезде фактілерді жарқыратады.

Жерге қосу немесе қалпына келтіру жасанды интеллектті сенімді ете ме?

Жерге қосу дегеніміз тұманнан емес, осыдан жауап алу. Алынған нәрсені үйренген үйіндіге бекіту. Ол сәтсіз болған кезде, сыпайы түрде сәтсіздікке ұшырайды: жіберіп алуға жақын құжат, жазылған жазба және сіздің тексеру инстинктіңіз уақытты үнемдейді. Жерге қосу - бұл еден, гало емес. Егер сіз алынған бөлікті тексере алмасаңыз, сіз әлі де тұмандасыз, тек жақсы жарықтандырумен. Бағалар немесе саясат тұжырымдамалары сияқты тірі күйдегі тапсырмаларды тұрақты кемемен араластырыңыз, сонда сіз қазірдің өзінде қозғалған әлем туралы өте сенімді жауап аласыз.

Неліктен демо жасанды интеллект сенімділігінің нашар сынағы болып табылады?

Таза тапсырма және модель мыңдаған туыстарын көрген тапсырма өткір көрінеді. Тікелей жұмыс процестерінде шатасқан қою, жетіспейтін файлдар және олардың мазасыздығын азайтатын бірінші жауапты қабылдайтын пайдаланушы болады. Көшбасшылар тақтасының ұпайы сіздің билеттеріңіздегі калибрлеу емес. Модель тәуекелі - бұл дыбыс деңгейінде қате болған кезде болатын нәрсе, оның викторина жиынтығынан өткен-өтпегені емес. Сізге қажет тесттер құрғақ: алынған үзіндінің ішінде болыңыз, блефтің орнына белгісіздікті белгілеңіз, қайта сөз тіркесін жасаған кезде бірізді болыңыз және ойлап табудың орнына жабылған сәтсіздікке жол беріңіз.

Егер ешкім адаспаса, жасанды интеллект сенімді ме?

Жоқ. Егер ешкім есеп бермесе, жүйе бұрынғыдай пайдаланылады. Адам циклдегі жүйе - ақаулық режимдеріне сәйкес келетін жалғыз дизайн: кім қарайды, кім тоқтата алады, не тіркеледі, қателіктен кейін не болады. Егер жауап "модель" болса, сізде жауап жоқ. Модельдер оқиғадан кейін кездесуге бармайды. Медицина, заң, несие немесе қауіпсіздікке қатысты маңызды операциялар үшін адам цикл, ал модель - дереккөз.

Қателерді анықтау үшін жасанды интеллектті қалай шақырамын?

Белгісіздікті әдейі сұраңыз: «Мұны не дұрыс істемейді?» «сенімді етуден» гөрі. Мүмкіндігінше қайталауды ұрпақтан ұрпаққа бөліңіз. Алдымен үзінділерді қараңыз, содан кейін мәтінді сұраңыз. Костюмді өзгертіңіз: қайта жазыңыз немесе керісінше дәлелдеуді сұраңыз. «Тек қойылған мәтіннен» немесе «егер жоқ болса, жоқ деп айтыңыз» сияқты шектеулерді күштеп енгізіңіз және әлі де тексеріңіз. Тексергіші бар тапсырмаларды артық көріңіз және ерекшелікке назар аударыңыз, себебі галлюцинация дәл осы жерде киінуді ұнатады.

Сілтемелер

  1. NIST - nvlpubs.nist.gov

  2. NIST - airc.nist.gov

  3. NIST - airc.nist.gov

  4. ICO - ico.org.uk

  5. NCSC - www.ncsc.gov.uk

  6. NCSC - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

Ресми AI көмекші дүкенінен ең соңғы AI-ді табыңыз

Біз туралы

Викторина
1. Мақалаға сәйкес, жасанды интеллект қасиет ретінде сенімді ме?

2. Жұмыс уақыты мен шыншылдықтың айырмашылығы неде?

3. Неліктен еркін сөйлейтін қате жауап ебедейсіз жауапқа қарағанда қауіптірек?

4. Harbour Membership 20 сұрақтан тұратын мысал ретінде берілген тестте тексерілмеген екінші ұшқышпен не болды?

5. Мақалаға сәйкес, тексерілетін алынған бөліксіз жерге қосу дегеніміз не?


Блогқа оралу