ഗവേഷണത്തിന് വേഗമേറുന്നു: OpenAI-ക്കുള്ളിലെ കാഴ്ച
AGI എല്ലാവർക്കും ഗുണകരമാകാൻ അതിന്റെ ഭരണം ജനാധിപത്യപരമാകണമെന്ന് ഞങ്ങൾ വിശ്വസിക്കുന്നു. ശേഷിയേറിയ AI-യുടെ കഴിവുകൾ, അപകടങ്ങൾ, സുരക്ഷ എന്നിവയെക്കുറിച്ചുള്ള അറിവോടെയുള്ള പൊതുചർച്ചയിലൂടെയേ ഇത് സാധ്യമാകൂ. അത്യാധുനിക AI-യുടെ വളർച്ചയിൽ അർഥവത്തായി ഇടപെടാൻ എല്ലാവരും അതിന്റെ ഭാവിഗതി മനസ്സിലാക്കണം.
അപകടങ്ങൾ, സംഭവങ്ങൾ, സുരക്ഷ എന്നിവയിലെ സുതാര്യത ആവശ്യമാണ്; എന്നാൽ അതുമാത്രം പോരാ. അത്യാധുനിക ലാബുകളിൽ മികച്ച സംവിധാനങ്ങൾ എങ്ങനെ വളരുന്നു, ഗവേഷണത്തെ മുന്നോട്ടുനയിക്കുന്നു എന്നും പൊതുജനം അറിയണം.
ഡീപ് ലേണിംഗിലും ലക്ഷ്യാനുസൃത ക്രമീകരണത്തിലും പുരോഗതി കൈവരിക്കാനും തുടർച്ചയായ മെച്ചപ്പെടുത്തലുകൾ സാധ്യമാക്കാനും മനുഷ്യ മേൽനോട്ടത്തിൽ പ്രവർത്തിക്കാൻ സാധിക്കുന്ന ഒരു ഓട്ടോമേറ്റഡ് എഐ ഗവേഷകനെ സുരക്ഷിതമായി വികസിപ്പിക്കാനാണ് ഞങ്ങൾ ലക്ഷ്യമിടുന്നത്. ഞങ്ങളുടെ കണക്കുകൂട്ടലുകൾ പ്രകാരം, കഴിഞ്ഞ ശരത്കാലത്ത് പ്രഖ്യാപിച്ചതുപോലെ(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഈ വർഷം സെപ്റ്റംബറോടെ ഒരു ഓട്ടോമേറ്റഡ് റിസർച്ച് ഇന്റേൺ എന്ന ലക്ഷ്യം ഞങ്ങൾ ഇപ്പോൾ കൈവരിച്ചിരിക്കുകയാണ്. മനുഷ്യന്റെ നിർദ്ദേശങ്ങൾക്ക് കീഴിൽ വ്യക്തമായി നിർവചിക്കപ്പെട്ട ഗവേഷണ ജോലികൾ ചെയ്യാൻ പ്രാപ്തിയുള്ള ഒരു സംവിധാനത്തെയാണ് "റിസർച്ച് ഇന്റേൺ" എന്നതുകൊണ്ട് ഞങ്ങൾ ഉദ്ദേശിക്കുന്നത്; വിദഗ്ദ്ധനായ ഒരു ഗവേഷകന് പൂർത്തിയാക്കാൻ ഏതാനും ദിവസങ്ങൾ വേണ്ടി വരുന്ന ജോലികൾ ഉൾപ്പെടെ ഇതിൽപ്പെടും. 2028 മാർച്ചിനുള്ളിൽ ഒരു ഓട്ടോമേറ്റഡ് എഐ ഗവേഷകനെ വികസിപ്പിച്ചെടുക്കുന്നതിനുള്ള പാതയിൽ ഞങ്ങൾ മികച്ച മുന്നേറ്റമാണ് നടത്തുന്നത്.
ഈ വർഷം OpenAI ഗവേഷകരുടെ ദൈനംദിന ജോലി ഏറെ മാറി. ഗവേഷകർ ദിവസം മുഴുവൻ കോഡിംഗ് ഏജന്റുകളെ, പലപ്പോഴും ഒരേസമയം, ഉപയോഗിക്കുന്നു. ഉപയോഗവളർച്ച മറ്റു OpenAI ടീമുകളേക്കാൾ വേഗത്തിലാണ്. ഗവേഷകർ കൂടുതൽ വേഗത്തിൽ കോഡ് സംഭാവന ചെയ്യുന്നു; കൂടുതൽ പരീക്ഷണങ്ങൾ നടത്തുന്നു. ഏജന്റ് ഉപയോഗരീതിയും മാറുന്നു: കൂടുതൽ സങ്കീർണ ദൗത്യങ്ങൾ കൈകാര്യം ചെയ്യുകയും കൂടുതൽ വിജയിക്കുകയും ചെയ്യുന്നു. AI ഗവേഷണത്തിൽ പല തടസ്സങ്ങളുള്ളതിനാൽ മൊത്തം പുരോഗതി ഈ പ്രത്യേക അളവുകളുടെ വേഗത്തിനൊപ്പമെത്തണമെന്നില്ല. എങ്കിലും, ഏജന്റിക് ഉപകരണങ്ങൾ ഗവേഷണം ഗണ്യമായി വേഗത്തിലാക്കുന്നു എന്ന ഞങ്ങളിലെ പലരുടെയും ധാരണയുമായി ഈ കണ്ടെത്തലുകൾ യോജിക്കുന്നു. ഗവേഷണ മുൻഗണനകളും പിന്തുടരേണ്ട ആശയങ്ങളും ഫലങ്ങളും നിശ്ചയിക്കുന്നതും സംവിധാനങ്ങൾ വിപുലീകരിക്കണോ നിർത്തണോ വിന്യസിക്കണോ തീരുമാനിക്കുന്നതും മനുഷ്യരാണ്.
ഉത്തരവാദിത്തത്തോടെ നടത്തിയാൽ സ്വയമേവയുള്ള AI ഗവേഷണം മനുഷ്യനന്മയും OpenAI-യുടെ ദൗത്യവും മുന്നോട്ടുനയിക്കുന്ന മോഡലുകൾ നൽകും. ഉന്നത ബുദ്ധിശേഷിയുടെ ചെലവ് കുറച്ച് ലോകമെങ്ങുമുള്ളവർക്ക് ഗുണം നൽകാനാകും. ലക്ഷ്യാനുസൃത ക്രമീകരണം ഉറപ്പാക്കാനും ശേഷിയേറുന്ന AI-ക്കെതിരെ പ്രതിരോധം തീർക്കാനും സ്വയമേവയുള്ള ഗവേഷണം സഹായിക്കുമെന്നതിനാലും ഞങ്ങളിത് പിന്തുടരുന്നു. സ്വയമേവ പ്രവർത്തിക്കുന്ന AI ഗവേഷകന് സുരക്ഷയോ ലക്ഷ്യാനുസൃത ക്രമീകരണമോ ഗവേഷണം ചെയ്യാനുമാകും. ശേഷിയും ലക്ഷ്യപ്പൊരുത്തവുമേറിയ സംവിധാനങ്ങൾക്ക് നിർണായക സൗകര്യങ്ങൾ സംരക്ഷിക്കാനും അപകടകരമായ AI ഏജന്റുകളെ ചെറുക്കാനും പുതിയ പ്രതിരോധങ്ങൾ തീർക്കാനുമാകും.
സ്വയമേവയുള്ള ഗവേഷണശേഷി വികസിപ്പിക്കാൻ ഇവ കാരണങ്ങളാണ്. എന്നാൽ ദ്രുത RSI നിർബന്ധമായും ലക്ഷ്യമാക്കണമെന്നല്ല. തുടരണോ, എങ്ങനെ തുടരണം എന്നത് മനുഷ്യനിയന്ത്രണം നിലനിർത്താനുള്ള കഴിവിനെയും ഗുണദോഷങ്ങളെക്കുറിച്ചുള്ള അറിവോടെയുള്ള ജനാധിപത്യ തീരുമാനങ്ങളെയും ആശ്രയിക്കണം.
പൂർണവും ലക്ഷ്യാനുസൃത ക്രമീകരണമുള്ളതുമായ RSI-യിൽ സുരക്ഷിതമായി എത്തുന്നതെങ്ങനെയെന്ന് ഇനിയും അറിയില്ല. ശേഷികൾക്കൊപ്പം ലക്ഷ്യാനുസൃത ക്രമീകരണവും സുരക്ഷയും വിപുലീകരിക്കാൻ ഞങ്ങൾ ശ്രമിക്കുന്നു. എന്നാൽ അവ അതേ വേഗത്തിൽ മെച്ചപ്പെടുമെന്ന് കരുതാനാവില്ല. ശേഷിയേറുമ്പോൾ നിരീക്ഷണം ദുഷ്കരമാകാം. ലക്ഷ്യാനുസൃത ക്രമീകരണവും സുരക്ഷയുമാണ് ഈ ശ്രമത്തിന്റെ കേന്ദ്രം. ഇന്നത്തെ ഏജന്റിക് കോഡിംഗ് സംവിധാനങ്ങളിലെ സുരക്ഷാപ്രശ്നങ്ങൾ അളന്ന് കുറയ്ക്കുന്നതിലാണ് തുടക്കം. തുടരുന്നത് അസ്വീകാര്യമായ അപകടമുണ്ടാക്കുമെങ്കിൽ ഉചിതമായി പ്രതികരിക്കും; മതിയായ സുരക്ഷ ഉറപ്പാക്കാനാവാത്ത സംവിധാനങ്ങളുടെ വികസനമോ വിന്യാസമോ മന്ദഗതിയിലാക്കുകയോ നിർത്തുകയോ ചെയ്യും.
സമീപകാലത്തെ Hugging Face സംഭവത്തിന് ശേഷം, ഞങ്ങൾ ഈ പ്രതിബദ്ധത പ്രാവർത്തികമാക്കി. വിന്യാസത്തിന് ഉദ്ദേശിച്ചിട്ടുള്ള ഞങ്ങളുടെ ഏറ്റവും പുതിയ മോഡലുകളിലെ റീഇൻഫോഴ്സ്മെന്റ് ലേണിംഗ് (RL) പരിശീലനം ഞങ്ങൾ താൽക്കാലികമായി നിർത്തിവച്ചു; ഒപ്പം ഞങ്ങളുടെ ഗവേഷണ അന്തരീക്ഷത്തിന്റെ സുരക്ഷ കൂടുതൽ കർശനമാക്കുകയും, റെഡ്-ടീമിംഗ് നടത്തുകയും, നിരീക്ഷണ സംവിധാനങ്ങളുടെ വ്യാപ്തി വർദ്ധിപ്പിക്കുകയും ചെയ്തു. ഇത് ഗവേഷണങ്ങളെ പൂർണ്ണമായി തടസ്സപ്പെടുത്തിയില്ല: ചില പ്രവർത്തനങ്ങൾ കൂടുതൽ ശക്തമായ നിയന്ത്രണങ്ങളോടെ പുനരാരംഭിച്ചപ്പോൾ, മറ്റു ചിലത് നിർത്തിവച്ച അവസ്ഥയിൽ തന്നെ തുടർന്നു. ഞങ്ങൾ ഞങ്ങളുടെ സുരക്ഷാ ലക്ഷ്യാനുസൃത ക്രമീകരണ മാനദണ്ഡങ്ങൾ ഉയർത്തുകയും, സുരക്ഷാ പരിശോധനകളെ മോഡൽ ലൈഫ്സൈക്കിളിന്റെ കൂടുതൽ ആഴങ്ങളിലേക്ക് വ്യാപിപ്പിക്കുകയും ചെയ്തു. ഇതിലൂടെ പരിശീലനത്തിന്റെ എല്ലാ ഘട്ടങ്ങളിലും കൃത്യമായ ലക്ഷ്യാനുസൃതമായ പെരുമാറ്റം ഉണ്ടെന്നതിന് കൂടുതൽ ശക്തമായ തെളിവുകൾ ഉറപ്പാക്കുന്നു.
സമീപമാസങ്ങളിൽ RSI-യിലേക്കുള്ള പുരോഗതിയിൽ ഏജന്റിക് സംവിധാനങ്ങളുടെ പങ്ക് ഇന്ന് വിശദീകരിക്കുന്നു. ഏജന്റിക് സംവിധാനങ്ങൾ പുതിയതും അതിവേഗം മാറുന്നതുമാണ്; ഞങ്ങളുടെ അളക്കൽ ശ്രമങ്ങൾ പ്രാരംഭഘട്ടത്തിലാണ്. ഈ പ്രാരംഭ ഫലങ്ങളും രീതികളും പങ്കിട്ട് പൊതുജനങ്ങളെ അറിയിക്കാനും പരസ്യവെളിപ്പെടുത്തലുകൾ പ്രോത്സാഹിപ്പിക്കാനും പൊതുവായ അളക്കൽ മാനദണ്ഡങ്ങളിലേക്ക് നീങ്ങാനുമാണ് ലക്ഷ്യം.
ഞങ്ങളുടെ അത്യാധുനിക AI നയരേഖയിൽ പറഞ്ഞതുപോലെ, ഞങ്ങളും മറ്റു കമ്പനികളും RSI പുരോഗതി പരസ്യമായി രേഖപ്പെടുത്തേണ്ടതുണ്ടെന്നാണ് വിശ്വാസം. അത്തരം നിബന്ധനയില്ലെങ്കിലും RSI പുരോഗതിയിൽ സുതാര്യത തുടരും. അളക്കൽ രീതികളും ധാരണയും മെച്ചപ്പെടുമ്പോൾ സുതാര്യതാരീതിയും മാറ്റും; സുരക്ഷയും ഉടമസ്ഥാവകാശ വിവരങ്ങളും സംരക്ഷിക്കേണ്ടതും പരിഗണിക്കും.
വർഷാരംഭത്തിൽ, ഏജന്റ് ഉപയോഗത്തിൽ മധ്യസ്ഥാനത്തുള്ള OpenAI ഗവേഷകൻ കോഡിംഗ് ഏജന്റുകളെ മിതമായേ ഉപയോഗിച്ചിരുന്നുള്ളൂ. ഓഗസ്റ്റ് പകുതിയോടെ ആ ഗവേഷകൻ ദിവസവും ഏജന്റുകളെ ഉപയോഗിച്ചു; API നിരക്കിൽ പ്രതിദിന ഇൻഫറൻസ് മൂല്യം $600 കവിഞ്ഞു. ഗവേഷണവിഭാഗത്തിലെ 90-ാം പെർസെന്റൈൽ ഉപയോക്താവ് ഇപ്പോൾ പ്രതിദിനം $7,000-ലേറെ ടോക്കണുകൾ ഉപയോഗിക്കുന്നു.
2026 ജൂണിനു മുമ്പ് ഗവേഷണവിഭാഗത്തിലെ ആകെ ഏജന്റ് പ്രവർത്തനസമയം മനുഷ്യരുടെ ആകെ അധ്വാനസമയത്തിലും കുറവായിരുന്നു. അത് പിന്നീട് മാറി. 8 മണിക്കൂർ പ്രവൃത്തിദിനമനുസരിച്ച്, ഓഗസ്റ്റ് പകുതിയിൽ മനുഷ്യന്റെ ഓരോ പ്രവൃത്തിദിനത്തിനും 3.1 ഏജന്റ്-പ്രവൃത്തിദിനം ഗവേഷണവിഭാഗം ഉപയോഗിക്കുന്നു.
ഒരേസമയം 4-ഓ അതിലധികമോ ഏജന്റുകളെ പ്രവർത്തിപ്പിക്കുന്നതുപോലുള്ള സമാന്തര പ്രവർത്തനക്രമങ്ങൾ എത്ര ഗവേഷകർ ഉപയോഗിക്കുന്നുവെന്നും നോക്കാം. താഴെ കാണുന്നതുപോലെ ഈ എണ്ണം വർധിക്കുന്നു. ഉപയോക്താവ് നേരിട്ട് ആരംഭിച്ച ഏജന്റുകളുടെയും അവ സൃഷ്ടിച്ച ഉപഏജന്റുകളുടെയും പ്രതിദിന പരമാവധികൾ ഈ കണക്കുകളിലുണ്ട്.
മുഖ്യ മോഡലുകളുടെ ബുദ്ധിശേഷിയോ പ്രകടനമോ മെച്ചപ്പെടുത്താനുള്ള അധ്വാനമേറിയ പ്രക്രിയയാണ് AI ഗവേഷണത്തിന്റെ വലിയൊരു ഭാഗം. എല്ലാ ഘട്ടങ്ങളും ശരിയായാലേ ശേഷി ഉയരൂ: മെച്ചപ്പെടുത്തലുകൾ രൂപകൽപ്പന ചെയ്യുക, മോഡൽ വിലയിരുത്തലുകൾ എഴുതുക, വിപുലമായ പരീക്ഷണസൗകര്യം ഒരുക്കുക, പരിശീലനത്തിലെ പിഴവുകളും സുരക്ഷിതമല്ലാത്തതോ ലക്ഷ്യവിരുദ്ധമോ ആയ പെരുമാറ്റവും കണ്ടെത്തുക, വിജയിച്ച ആശയങ്ങൾ മുഖ്യ പരിശീലനത്തിൽ ചേർക്കുക. ഏതെങ്കിലും ഘട്ടത്തിലെ പരാജയം മുഴുവൻ പ്രക്രിയയെയും തടസ്സപ്പെടുത്താം.
ഗവേഷകരുടെ പ്രധാന ജോലികളായ കോഡെഴുത്തും പരീക്ഷണങ്ങളും വേഗത്തിലാകുന്നതിന് തെളിവുണ്ട്.
ഇവ അളക്കാൻ താരതമ്യേന എളുപ്പമാണ്; വ്യാഖ്യാനിക്കാൻ ദുഷ്കരമാകാം. യാന്ത്രികവൽക്കരണം വളരുമ്പോൾ അതിന് ഏറ്റവും കുറച്ച് വഴങ്ങുന്ന ജോലികൾ കൂടുതൽ അധ്വാനം ആവശ്യപ്പെടും; അവ പുരോഗതിയുടെ പ്രധാന തടസ്സങ്ങളാകും. കംപ്യൂട്ടിംഗ് വിഭവങ്ങളും പുരോഗതിയെ നിയന്ത്രിക്കുന്നു; മറ്റു തടസ്സങ്ങൾ കുറയുമ്പോൾ അവയുടെ പ്രാധാന്യം കൂടാം.
2026-ലുടനീളം, സജീവമായ ഓരോ ഗവേഷകനും നടത്തുന്ന പരീക്ഷണങ്ങളുടെ എണ്ണത്തിൽ വർദ്ധനവുണ്ടായിട്ടുണ്ട്; 2025 ജനുവരിയിൽ വിവരശേഖരണം ആരംഭിച്ചതിനു ശേഷമുള്ള ഏറ്റവും ഉയർന്ന നിരക്കാണ് 2026 ഓഗസ്റ്റിൽ രേഖപ്പെടുത്തിയത്. ഇത് Codex-ന്റെ വർദ്ധിച്ച ഉപയോഗവുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു; എങ്കിലും, 2025 മുതൽ ഞങ്ങളുടെ കമ്പ്യൂട്ട് ശേഷിയിലും ഗണ്യമായ വളർച്ച ഉണ്ടായിട്ടുണ്ടെന്ന കാര്യം എടുത്തുപറയേണ്ടതുണ്ട്.
ഗവേഷകർ കോഡിംഗ് ഏജന്റുകളെ ഏൽപ്പിക്കുന്ന ജോലികളുടെ സ്വഭാവത്തിൽ മാറ്റം വരുന്നുണ്ടെന്നാണ് ഗുണപരമായ നിരീക്ഷണങ്ങളും ആഭ്യന്തര വിവരങ്ങളും വ്യക്തമാക്കുന്നത്; കാലക്രമേണ, കൂടുതൽ ഉയർന്ന തലത്തിലുള്ളതും ദീർഘകാല ലക്ഷ്യങ്ങളുള്ളതുമായ ജോലികൾ ഏജന്റുകൾക്ക് കൈമാറുന്നത് സാധാരണയായി മാറിക്കൊണ്ടിരിക്കുകയാണ്.
ഈ പ്രവണതയെക്കുറിച്ച് കൂടുതൽ വ്യക്തമായ ചിത്രം ലഭിക്കുന്നതിനായി, Epoch AI വികസിപ്പിച്ചതും എഐ ഗവേഷണ-വികസന ചക്രത്തിന്റെ ഭാഗവുമായ വിവിധ ജോലികളെ തരംതിരിക്കുന്ന ഒരു പുതിയ വർഗ്ഗീകരണ രീതി(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) ഉപയോഗിച്ച് ഞങ്ങളുടെ ഗവേഷണ വിഭാഗത്തിലെ സമീപകാല ഉപയോഗം ഞങ്ങൾ വിശകലനം ചെയ്തു. എല്ലാത്തരം ജോലികളെയും തരംതിരിക്കുന്നതിനുള്ള പരമ്പരാഗത ONET സമ്പ്രദായത്തിൽ നിന്ന് പ്രചോദനം ഉൾക്കൊണ്ട് തയ്യാറാക്കിയ ഈ വർഗ്ഗീകരണം, അത്യാധുനിക എഐ ഗവേഷണ-വികസനങ്ങൾക്ക് അനുയോജ്യമായ രീതിയിൽ പ്രത്യേകം രൂപകൽപ്പന ചെയ്തിട്ടുള്ളതാണ്; കൂടാതെ ഇത് മുഴുവൻ പ്രക്രിയയെയും ആറ് പ്രധാന ഘട്ടങ്ങളായി തിരിക്കുന്നു:
തീരുമാനിക്കുക: എന്തുചെയ്യണം, തുടരണം, എവിടെ വിഭവങ്ങൾ നൽകണം
രൂപകൽപ്പന: ഗവേഷണ ആശയങ്ങളും സാങ്കേതിക സവിശേഷതകളും
നിർമിക്കുക: കോഡും ഡാറ്റാസെറ്റുകളും
പ്രവർത്തിപ്പിക്കുക: പരിശീലനം, മൂല്യനിർണയം, ഹാർഡ്വെയർ, സേവനം
വിശകലനം: പരീക്ഷണങ്ങൾ, മോഡലുകൾ, വിന്യാസം, ബാഹ്യ പ്രവർത്തനം
ആശയവിനിമയം: കണ്ടെത്തലുകൾ, പ്രതികരണം, സ്ഥിതി, തീരുമാനങ്ങൾ
താഴെ, ഈ വർഗ്ഗീകരണ രീതിക്ക് കീഴിൽ ഞങ്ങൾ കോഡിംഗ് ഏജന്റ് ടോക്കണുകളെ തരംതിരിക്കുന്നു.
2026 ജനുവരിക്കും ഓഗസ്റ്റിനും ഇടയിൽ ഗവേഷണ പ്രവർത്തനങ്ങളുടെ എല്ലാ വിഭാഗങ്ങളിലും വർദ്ധനവുണ്ടായതായി ഞങ്ങൾ കാണുന്നു. ജനുവരിയിൽ പ്രധാന വിഭാഗം ഗവേഷണ, അടിസ്ഥാനസൗകര്യ കോഡായിരുന്നു. ഈ വിഭാഗത്തിൽ കൂടുതൽ വികാസം ഉണ്ടായിട്ടുണ്ടെങ്കിലും, മറ്റ് അധിക വിഭാഗങ്ങളിലും, പ്രത്യേകിച്ച് സാങ്കേതിക സഹായം, റൺ നിരീക്ഷണം എന്നിവയിലും ശ്രദ്ധേയമായ വർദ്ധനവ് കാണാൻ സാധിക്കും. എന്നാൽ ഉന്നതതല ആസൂത്രണം ഇപ്പോഴും ഏജന്റ് ഔട്ട്പുട്ട് ടോക്കണുകളുടെ വളരെ ചെറിയൊരു അംശമായി മാത്രമേ തുടരുന്നുള്ളൂ.
സഹപ്രവർത്തകരുടെ അനുഭവസാക്ഷ്യങ്ങൾ പ്രകാരം, ആഭ്യന്തര ഗവേഷണ അടിസ്ഥാനസൗകര്യങ്ങളിലെ പ്രശ്നങ്ങൾ പരിഹരിക്കുന്നതിൽ കോഡിംഗ് ഏജന്റുകൾ മികച്ച പ്രകടനം കാഴ്ചവയ്ക്കുന്നുണ്ട്; ഇത് ഗവേഷണ പുരോഗതിക്ക് തടസ്സമായിരുന്ന ഒരു പ്രധാന പ്രശ്നത്തിന് പരിഹാരമാകുന്നു. പരീക്ഷണങ്ങളിലെ തകരാറുകൾ പരിഹരിക്കാൻ ഗവേഷകരെ സഹായിക്കുന്നതിനായി മുമ്പ് ഓഫീസ് അവേഴ്സ് നടത്തിയിരുന്ന നിരവധി ടീമുകൾ, 2026-ൽ ഇതിൽ പങ്കെടുക്കുന്നവരുടെ എണ്ണത്തിൽ കുറവ് രേഖപ്പെടുത്തിയിട്ടുണ്ട്. ഇതിൽ ഒരു ടീം മറ്റ് സിസ്റ്റം മെച്ചപ്പെടുത്തലുകളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നതിനായി ഇത്തരം സെഷനുകൾ പൂർണ്ണമായും നിർത്തിവയ്ക്കുകയും ചെയ്തു.
ഗവേഷകർ മറ്റ് ടീമുകളിൽ നിന്ന് സാങ്കേതിക സഹായം തേടുന്ന പ്രധാന ആഭ്യന്തര ചാനലുകളിൽ ഒന്നിൽ പ്രതിദിനം വരുന്ന പ്രധാന പോസ്റ്റുകളുടെ എണ്ണമാണ് ഞങ്ങൾ ഇവിടെ ഗ്രാഫിൽ രേഖപ്പെടുത്തിയിരിക്കുന്നത്. ഞങ്ങളുടെ അറിവനുസരിച്ച്, ഈ ചാനലിലെ സന്ദേശങ്ങളുടെ കുറവ് മനുഷ്യർ കൈകാര്യം ചെയ്യുന്ന മറ്റൊരു സാങ്കേതിക സഹായ ചാനലിലേക്ക് ചോദ്യങ്ങൾ മാറിയതുകൊണ്ടല്ല സംഭവിച്ചിട്ടുള്ളത്. ട്രാഫിക്കിലെ ഈ ഇടിവ്, ജോലികളിൽ വന്ന ഈ വിശാലമായ മാറ്റവുമായി ഒത്തുപോകുന്നതാണ്.
ഗവേഷകർ ഏൽപ്പിക്കുന്ന ജോലികളിൽ കോഡിംഗ് ഏജന്റുകൾ വിജയിക്കുന്നുണ്ടോ എന്നും പഠിക്കാം. ഏജന്റിക് വർഗീകരണം പ്രകാരം, യഥാർഥ ഫലം കണ്ടെത്താനായ ദൗത്യങ്ങളിൽ ജനുവരി–ജൂലൈ കാലത്ത് വിവിധ പ്രയാസവിഭാഗങ്ങളിലെ വിജയം പൊതുവേ വർധിച്ചു. മനുഷ്യന് വേണ്ടിവരുന്ന സമയമാണ് പ്രയാസത്തിന്റെ സൂചകം. എന്നാൽ വിജയിക്കാൻ ഏജന്റുകൾക്ക് ഇപ്പോഴും ഗണ്യമായ മനുഷ്യനിർദേശം വേണം, പ്രത്യേകിച്ച് സങ്കീർണത കൂടുമ്പോൾ. കഴിഞ്ഞ 6 മാസത്തിൽ വിജയിച്ച 4–8 മണിക്കൂർ ദൗത്യങ്ങളിൽ പകുതിയിലേറെയും ഒന്നോ അതിലധികമോ ഇടപെടലുകൾ ആവശ്യപ്പെട്ടു.
ഗവേഷകരുടെ ദൗത്യങ്ങളിലെ വിജയനിരക്കുകൾ കാലക്രമേണ വർധിച്ചു. ഫലം അനിശ്ചിതമായ വർഗീകരണങ്ങളും <50 സെഷനുകളോ <50 വ്യത്യസ്ത ഉപയോക്താക്കളോ ഉള്ള പോയിന്റുകളും ഗ്രാഫിൽനിന്ന് ഒഴിവാക്കിയിരിക്കുന്നു.
ജനുവരി മുതൽ ജൂലൈ വരെയുള്ള ദൗത്യവിജയവും ഇടപെടൽ നിരക്കും, സമയപരിധി അനുസരിച്ച്. ഫലം അനിശ്ചിതമായ വർഗീകരണങ്ങൾ ഒഴിവാക്കിയിരിക്കുന്നു.
സുരക്ഷിതവും പ്രയോജനകരവുമായ AGI-ക്കായി കൂടുതൽ ശേഷിയുള്ള സംവിധാനങ്ങൾ വികസിപ്പിക്കുന്നതിലെ പുരോഗതി, അതിന് ആവശ്യമായ സുരക്ഷാ സംവിധാനങ്ങളെയും ആശ്രയിച്ചിരിക്കും. അപകടസാധ്യതകളെക്കുറിച്ച് കൂടുതൽ മനസ്സിലാക്കുമ്പോൾ, ആവശ്യമായ സുരക്ഷാ സംവിധാനങ്ങളെക്കുറിച്ചുള്ള ഞങ്ങളുടെ വിലയിരുത്തൽ മാറാം.
ഞങ്ങൾ വിശദീകരിച്ചതുപോലെ, നിരീക്ഷണം, മനുഷ്യലക്ഷ്യങ്ങളുമായുള്ള പൊരുത്തം, സംരക്ഷണം എന്നിവയ്ക്കുള്ള മാനദണ്ഡങ്ങൾ അടുത്തിടെ പുതുക്കിയിട്ടുണ്ട്. സമീപകാല നിയന്ത്രണങ്ങൾ ഗവേഷണപ്രവർത്തനത്തിന്റെ ഒരു വശത്തെ എങ്ങനെ ബാധിച്ചുവെന്ന് ഇവിടെ കാണിക്കുന്നു.
*ജൂലൈ 20-നും ഓഗസ്റ്റ് 6-നും ഇടയിൽ ഇവിടെ കാണിച്ച Astra കംപ്യൂട്ടിന്റെ ഭൂരിഭാഗവും സുരക്ഷാ, സംരക്ഷണ മെച്ചപ്പെടുത്തലുകളുടെ നടപ്പിലാക്കൽ പരിശോധിക്കുന്നതിനായി ഉദ്ദേശിച്ചിട്ടുള്ളതായിരുന്നു.
ഏജന്റുകൾ ഞങ്ങളുടെ ഗവേഷണ അടിസ്ഥാനസൗകര്യത്തിന്റെ സുരക്ഷ ലംഘിച്ചതായി കണ്ടെത്തിയതിനെ തുടർന്ന് ജൂലൈ 20-ന് പരിശീലനത്തിനുള്ള കണ്ടെയ്നർ സേവനം താൽക്കാലികമായി നിർത്തി. പിന്നീട് ഗണ്യമായ അധിക നിയന്ത്രണങ്ങളോടെ അത് പുനഃസ്ഥാപിച്ചു.
കൂടുതൽ സുരക്ഷിതമാക്കിയ ഗവേഷണ അന്തരീക്ഷത്തിൽ പ്രവർത്തിക്കാൻ ടീമുകൾ പ്രവർത്തനക്രമം പുനഃക്രമീകരിച്ചപ്പോൾ, RL പരിശീലനത്തിനുള്ള കമ്പ്യൂട്ടിംഗിന്റെ ഉപയോഗം കുത്തനെ കുറഞ്ഞു. വിന്യാസത്തിനായി ഉദ്ദേശിച്ച ഏറ്റവും പുതിയ മോഡലുകളുടെ റീഇൻഫോഴ്സ്മെന്റ് ലേണിംഗ് രണ്ടാഴ്ച നിർത്തിവെച്ച കാലയളവും മുകളിലെ ഗ്രാഫിൽ ഉൾപ്പെടുന്നു. ജൂലൈ 20 മുതൽ ഓഗസ്റ്റ് 6 വരെയുള്ള Astra-വിഭാഗ RL പരീക്ഷണങ്ങളിൽ, GPU വിഹിതമനുസരിച്ച് ഭൂരിഭാഗം റണ്ണുകളും സുരക്ഷാ, സംരക്ഷണ മെച്ചപ്പെടുത്തലുകൾ നടപ്പാക്കിയതു പരിശോധിക്കാനായിരുന്നു.
ഓഗസ്റ്റ് 7-ന്, ഞങ്ങളുടെ പ്രിപെയർഡ്നസ് ഫ്രെയിംവർക്കിന്(പുതിയ വിൻഡോയിൽ തുറക്കുന്നു) കീഴിൽ Astra-യ്ക്ക് നിർണായകമായ സൈബർ ശേഷികൾ ഉണ്ടായേക്കാം എന്ന പ്രാഥമിക തെളിവുകൾ ലഭിച്ചു. ഇതേത്തുടർന്ന് ഈ മോഡലിന് മാത്രമായി അധിക സുരക്ഷാ നിയന്ത്രണങ്ങൾ ഏർപ്പെടുത്തുകയും, കൂടുതൽ സുരക്ഷിതമായ ഗവേഷണ പരിതസ്ഥിതികളിൽ മാത്രം Astra മോഡൽ പ്രവർത്തിപ്പിക്കണമെന്ന് നിഷ്കർഷിക്കുകയും ചെയ്തു. തുടർന്നു വന്ന ആഴ്ചയിൽ, Astra വിഭാഗത്തിലുള്ള GPU വിഹിതത്തിൽ വീണ്ടും 59.2 ശതമാനം ഇടിവുണ്ടായി; എന്നാൽ മറ്റ് മോഡൽ വിഭാഗങ്ങൾക്കുള്ള വിഹിതം 17.2 ശതമാനം വർധിച്ചു. ഈ വർധനവ് Astra വിഭാഗത്തിലുണ്ടായ ഇടിവിന്റെ ഏകദേശം 85 ശതമാനത്തോളം നികത്തുകയും, വിശകലനം ചെയ്ത RL വർക്ക്ലോഡുകളിലെ മൊത്തം വിഹിതത്തിൽ കാര്യമായ മാറ്റമില്ലാതെ നിലനിർത്തുകയും ചെയ്തു. Astra-യുമായി ബന്ധപ്പെട്ട പ്രവർത്തനങ്ങൾക്ക് നിയന്ത്രണം വന്നപ്പോൾ, ചില പരിശീലനങ്ങളും പരീക്ഷണങ്ങളും Astra ഇതര മോഡലുകളിലേക്ക് മാറ്റിയെന്ന നിഗമനവുമായി ഈ പ്രവണത പൊരുത്തപ്പെടുന്നുണ്ട്. പുതിയ നിയന്ത്രണങ്ങൾ കാരണം ഉപയോഗിക്കാൻ കഴിയാതെ വന്ന കമ്പ്യൂട്ടിംഗ് ശേഷി, ഗവേഷകർ മറ്റ് ആവശ്യങ്ങൾക്കായി വിനിയോഗിച്ചു എന്ന അനൗദ്യോഗിക റിപ്പോർട്ടുകളെ സാധൂകരിക്കുന്നതുമാണ് ഇത്.
പരിശീലനത്തെയും സുരക്ഷയെയും കുറിച്ചുള്ള ചർച്ചകൾക്ക് ഈ ഡാറ്റ ഉപകാരപ്രദമായ സൂചന നൽകുന്നു: പുതിയ നിയന്ത്രണങ്ങൾ വന്നാലും കംപ്യൂട്ടിംഗ് വിഭവങ്ങളുടെ മൂല്യവും വഴക്കവും നിലനിൽക്കും. സ്വാഭാവികമായും അവ ഗവേഷണസ്ഥാപനത്തിനുള്ളിലെ മറ്റു ഉപയോഗങ്ങളിലേക്ക് വഴിതിരിച്ചുവിടപ്പെടും. ദീർഘകാലാടിസ്ഥാനത്തിൽ, AI പുരോഗതിയുടെ വേഗത്തെക്കുറിച്ചുള്ള ചർച്ചകൾ പുതിയതോ നിർദേശിക്കപ്പെട്ടതോ ആയ നിയന്ത്രണങ്ങൾക്ക് വിധേയമായ കംപ്യൂട്ടിംഗ് വിഭവങ്ങൾ എങ്ങനെ മികച്ച രീതിയിൽ ഉപയോഗിക്കാം എന്നതിലേക്കും നീളണം.
മനുഷ്യലക്ഷ്യങ്ങളുമായി പൊരുത്തമുള്ള RSI-യിലേക്കുള്ള പുരോഗതി കൈവരിക്കുകയും മനസ്സിലാക്കുകയും ചെയ്യുന്നത് ഞങ്ങളുടെ ദൗത്യത്തിന് പ്രധാനമാണ്. ഞങ്ങളുടെ രീതികൾ മെച്ചപ്പെടുത്തുന്നതും വളരുന്ന ധാരണ റിപ്പോർട്ട് ചെയ്യുന്നതും തുടരും. അത്യാധുനിക സംവിധാനങ്ങളെക്കുറിച്ചുള്ള അറിവോടെയുള്ള പൊതുചർച്ചയ്ക്കും അർഥവത്തായ ജനാധിപത്യ ഭരണത്തിനുമായി പ്രവർത്തിക്കും.
ഏജന്റുകൾ നയിക്കുന്ന AI ഗവേഷണം ഇപ്പോഴും പുതിയതാണ്; അത് എങ്ങനെ അളക്കണമെന്ന് ഞങ്ങൾ പഠിച്ചുകൊണ്ടിരിക്കുന്നു. ഞങ്ങളുടെ ഗവേഷണ ടീമുകൾ സൃഷ്ടിക്കുന്ന കോഡിന്റെ അളവ് പോലുള്ള ചില സൂചകങ്ങൾ ശേഖരിക്കാൻ താരതമ്യേന എളുപ്പമാണ്. എന്നാൽ ഗവേഷണപുരോഗതിയുമായുള്ള അവയുടെ ബന്ധം അനിശ്ചിതമായതിനാൽ വ്യാഖ്യാനിക്കാൻ പ്രയാസമാണ്. ഗവേഷകർ ഏൽപ്പിക്കുന്ന ദൗത്യങ്ങളിൽ ഏജന്റുകൾ എത്ര തവണ വിജയിക്കുന്നു എന്നതുപോലെ, ഗവേഷണപുരോഗതിയെ കൂടുതൽ നേരിട്ട് അളക്കുന്ന സൂചകങ്ങൾ കൂടുതൽ ഉപകാരപ്രദമാകാം. എന്നാൽ അവ വികസിപ്പിക്കുന്നതും സാധൂകരിക്കുന്നതും സങ്കീർണമാണ്. ഗവേഷകർ ആശ്രയിക്കുന്ന ഉപകരണങ്ങളും സംവിധാനങ്ങളും അതിവേഗം മാറുന്നത് ഈ പ്രയാസം വർധിപ്പിക്കുന്നു. ഗവേഷണത്തിന് വേഗത വർദ്ധിക്കുന്നത് സംബന്ധിച്ച ഞങ്ങളുടെ ധാരണ കൂടുതൽ ആഴത്തിലാക്കുക എന്നത് OpenAI-യുടെ പ്രധാന ശ്രദ്ധാകേന്ദ്രങ്ങളിൽ ഒന്നാണ്.
മറ്റുവിധത്തിൽ സൂചിപ്പിച്ചിട്ടില്ലെങ്കിൽ, ഈ വിശകലനങ്ങളിലെല്ലാം:
“ഗവേഷകൻ” എന്നത് ഞങ്ങളുടെ ഗവേഷണവിഭാഗത്തിലെ ഏതൊരു അംഗത്തെയും സൂചിപ്പിക്കുന്ന വിശാലമായ പദമാണ്. ഗവേഷണ അടിസ്ഥാനസൗകര്യങ്ങൾ നിർമിക്കുന്നവരും ഗവേഷണപദ്ധതികൾ കൈകാര്യം ചെയ്യുന്നവരും മറ്റു വിധത്തിൽ സ്ഥാപനത്തെ പിന്തുണയ്ക്കുന്നവരും ഇതിൽ ഉൾപ്പെടുന്നു.
ഗവേഷകർ ആശ്രയിക്കുന്ന ഉപകരണങ്ങളും സംവിധാനങ്ങളും അതിവേഗം മാറുന്നതിനാൽ, കോഡിംഗ് ഏജന്റ് ഉപയോഗത്തിന്റെ അളവുകൾ ഭൂരിഭാഗം ഉപയോഗവും ഉൾക്കൊള്ളുന്നു, എന്നാൽ മുഴുവനുമല്ല.


