Stripe пусна нов пакет от тестове за оценка на това колко ефективно AI агентите се справят с цялостни задачи по разработване на софтуер. Въпреки че моделите показват потенциал в генерирането на код, проучването подчертава значителни слабости в управлението на състоянието, верификацията и възстановяването от грешки при сложни работни процеси.