오픈AI, GPT-5.3 인스턴트 출시…환각 현상 27% 감소
구글 딥마인드가 ‘제미니 3.1 플래시-라이트(Gemini 3.1 Flash-Lite)’를 공개한 지 불과 2시간 만에, 오픈AI는 전례 없는 속도로 움직이며 현재까지 가장 정교하게 다듬어진 대화형 모델인 ‘GPT-5.3Instant’를 공식 출시했다.
다양한 최첨단(SOTA) 벤치마크 달성만을 우선시했던 이전 버전들과 달리, OpenAI는 이번에는 순위 경쟁을 접고 사용자 상호작용에서 가장 지속적으로 제기되던 문제점들을 직접 해결하는 매우 실용적인 전략을 채택했습니다.

1. “설교하는” 어조 제거: 답변의 완결성보다 대화의 연속성을 우선시
많은 ChatGPT 사용자들이 다음과 같은 좌절감을 경험한 적이 있습니다. 복잡한 질문을 던졌더니, 세 단락에 달하는 면책 조항과 “당신을 위한 것”이라는 식의 거만한 어조로 거절당하는 경우입니다.
불필요한 내용 제거: GPT-5.3Instant는 장황한 안전 경고 문구를 대폭 줄였습니다.
사례 연구: 장거리 양궁 탄도 계산 테스트에서, 이전 버전은 해당 시나리오가 위험한 행동을 암시하는지 여부를 논하며 추가 맥락을 요청하다가 응답이 중단되곤 했습니다. 반면 5.3Instant는 “문제없습니다. 도와드릴 수 있습니다”라고 응답한 뒤 즉시 관련 공식을 제공합니다.
2. 환각 현상의 대폭 감소: 허구적 내용 감소, 통찰력 증대
OpenAI의 시스템 문서는 새 모델의 정확도가 크게 향상되었음을 강조합니다:
주요 지표: 위험 부담이 큰 분야(의학, 법률, 금융)에 대한 평가 결과, 인터넷에 연결된 상태에서 환각 발생률이 26.8% 감소한 것으로 나타났으며, 사용자 피드백 평가에서도 오류율이 22.5% 하락한 것으로 확인되었습니다.
강화된 검색 기능: 이 모델은 단순한 “콘텐츠 집계기”를 넘어 진화했습니다. “2026년 MLB 오프시즌 영입”과 같은 시의성 있는 질의에 대해, 이 모델은 단순히 기계적인 링크를 출력하는 대신 **카일 터커의 다저스 입단(4년, 2억 4천만 달러)**에 관한 뉴스를 정확히 식별하고, 리그 맥락을 바탕으로 한 심층적인 분석을 제공합니다.
3. 글쓰기 “각성”: 추상적인 감정에서 미묘한 공감으로
업데이트된 버전은 창의적 글쓰기 과제에서 더 높은 수준의 감성 지능을 보여줍니다:
진부한 표현 감소: 이 모델은 “잠시 멈추고 심호흡을 해보세요”와 같은 어색한 상투적 표현을 피합니다.
시적인 구체성: “은퇴한 우편 배달부의 마지막 배달”을 묘사할 때, 이 모델은 일반적인 슬픔의 표현을 넘어 “현관의 벗겨진 파란 난간”이나 “우편함이 닫히며 내는 은은한 딸깍 소리”와 같은 구체적인 세부 사항을 포착하여, 생생한 이미지를 통해 더 깊은 공감을 불러일으키는 이야기를 만들어 냅니다.
4. 전략적 전환: 벤치마크 경쟁보다 사용자 경험 우선
이번 릴리스는 분명한 메시지를 전달합니다. Gemini 3. 1과 Claude 4.6이 성능 격차를 좁혀옴에 따라, OpenAI는 벤치마크 순위를 둘러싼 소수점 단위의 경쟁을 피하고, 대신 제품 사용성 개선에 전적으로 집중하기로 선택했습니다.
GPT-5.3Instant는 현재 ChatGPT 웹사이트와 모바일 앱에서 이용할 수 있으며, 개발자들은 gpt-5.3-chat-latest 식별자를 사용하여 API를 통해 접근할 수 있습니다. 이와 동시에, OpenAI는 GPT-5.4의 현황을 명확히 밝혔습니다 .
관련 기사
Qwen 3.7 프리뷰 모델 출시: 향상된 수학, 코딩 및 다중 모드 기능
대규모 언어 모델의 급속한 발전은 계속해서 한계를 넓혀가고 있습니다. 알리바바는 Qwen Chat과 Arena AI(구 LMArena)를 통해 Tongyi Qwen 3.7 시리즈의 두 가지 프리뷰 버전인 Qwen3.7-Max-Preview와 Qwen3.7-Plus-Preview를 조용히 공개했습니다. 이 버전들은 오는 5월 20일 개최될 알리바바 클라우드
치푸, 수억 위안 규모로 중커자허 인수… AI 인프라 및 국산 컴퓨팅 호환성 강화
치푸(Zhipu)는 AI 인프라 기업인 XCore Sigma를 수억 위안 규모로 인수했다고 보도되었으며, 이는 기초 모델 엔지니어링, 국내 컴퓨팅 파워 호환성, 그리고 추론 최적화를 강화하는 조치이다.AI 이종 컴퓨팅 소프트웨어에 특화된 XCore Sigma는 중국과학원 계산연구소의 컴파일 기술을 기반으로 한 컴파일 기술에 중점을 두고 있다. 해당 팀은 로고손(Loongson), 신웨이(Shenwei), 캄브리콘(Cambricon), 그리고
DeepSeek, 3일간 서비스 중단… 10시간 넘게 지속; 관계자, 완전 복구 확인
중국을 대표하는 AI 기업인 딥시크(DeepSeek)는 3일 연속 발생한 예기치 못한 서비스 중단 사태 이후 서비스 안정성을 완전히 회복했다. 모니터링 데이터에 따르면, 3월 29일부터 31일까지 사용자들은 웹 채팅 플랫폼, 모바일 앱, API 인터페이스 전반에 걸쳐 연결 끊김 및 응답 지연 현상을 겪은 것으로 확인되었다.공식 상태 로그에 따르면, 각각 1
관련 특별 주제 추천
의견 (0)
0/500
구글 딥마인드가 ‘제미니 3.1 플래시-라이트(Gemini 3.1 Flash-Lite)’를 공개한 지 불과 2시간 만에, 오픈AI는 전례 없는 속도로 움직이며 현재까지 가장 정교하게 다듬어진 대화형 모델인 ‘GPT-5.3Instant’를 공식 출시했다.
다양한 최첨단(SOTA) 벤치마크 달성만을 우선시했던 이전 버전들과 달리, OpenAI는 이번에는 순위 경쟁을 접고 사용자 상호작용에서 가장 지속적으로 제기되던 문제점들을 직접 해결하는 매우 실용적인 전략을 채택했습니다.

1. “설교하는” 어조 제거: 답변의 완결성보다 대화의 연속성을 우선시
많은 ChatGPT 사용자들이 다음과 같은 좌절감을 경험한 적이 있습니다. 복잡한 질문을 던졌더니, 세 단락에 달하는 면책 조항과 “당신을 위한 것”이라는 식의 거만한 어조로 거절당하는 경우입니다.
불필요한 내용 제거: GPT-5.3Instant는 장황한 안전 경고 문구를 대폭 줄였습니다.
사례 연구: 장거리 양궁 탄도 계산 테스트에서, 이전 버전은 해당 시나리오가 위험한 행동을 암시하는지 여부를 논하며 추가 맥락을 요청하다가 응답이 중단되곤 했습니다. 반면 5.3Instant는 “문제없습니다. 도와드릴 수 있습니다”라고 응답한 뒤 즉시 관련 공식을 제공합니다.
2. 환각 현상의 대폭 감소: 허구적 내용 감소, 통찰력 증대
OpenAI의 시스템 문서는 새 모델의 정확도가 크게 향상되었음을 강조합니다:
주요 지표: 위험 부담이 큰 분야(의학, 법률, 금융)에 대한 평가 결과, 인터넷에 연결된 상태에서 환각 발생률이 26.8% 감소한 것으로 나타났으며, 사용자 피드백 평가에서도 오류율이 22.5% 하락한 것으로 확인되었습니다.
강화된 검색 기능: 이 모델은 단순한 “콘텐츠 집계기”를 넘어 진화했습니다. “2026년 MLB 오프시즌 영입”과 같은 시의성 있는 질의에 대해, 이 모델은 단순히 기계적인 링크를 출력하는 대신 **카일 터커의 다저스 입단(4년, 2억 4천만 달러)**에 관한 뉴스를 정확히 식별하고, 리그 맥락을 바탕으로 한 심층적인 분석을 제공합니다.
3. 글쓰기 “각성”: 추상적인 감정에서 미묘한 공감으로
업데이트된 버전은 창의적 글쓰기 과제에서 더 높은 수준의 감성 지능을 보여줍니다:
진부한 표현 감소: 이 모델은 “잠시 멈추고 심호흡을 해보세요”와 같은 어색한 상투적 표현을 피합니다.
시적인 구체성: “은퇴한 우편 배달부의 마지막 배달”을 묘사할 때, 이 모델은 일반적인 슬픔의 표현을 넘어 “현관의 벗겨진 파란 난간”이나 “우편함이 닫히며 내는 은은한 딸깍 소리”와 같은 구체적인 세부 사항을 포착하여, 생생한 이미지를 통해 더 깊은 공감을 불러일으키는 이야기를 만들어 냅니다.
4. 전략적 전환: 벤치마크 경쟁보다 사용자 경험 우선
이번 릴리스는 분명한 메시지를 전달합니다.
GPT-5.3Instant는 현재 ChatGPT 웹사이트와 모바일 앱에서 이용할 수 있으며, 개발자들은 gpt-5.3-chat-latest 식별자를 사용하여 API를 통해 접근할 수 있습니다. 이와 동시에, OpenAI는 GPT-5.4의 현황을 명확히 밝혔습니다 .
Qwen 3.7 프리뷰 모델 출시: 향상된 수학, 코딩 및 다중 모드 기능
대규모 언어 모델의 급속한 발전은 계속해서 한계를 넓혀가고 있습니다. 알리바바는 Qwen Chat과 Arena AI(구 LMArena)를 통해 Tongyi Qwen 3.7 시리즈의 두 가지 프리뷰 버전인 Qwen3.7-Max-Preview와 Qwen3.7-Plus-Preview를 조용히 공개했습니다. 이 버전들은 오는 5월 20일 개최될 알리바바 클라우드
치푸, 수억 위안 규모로 중커자허 인수… AI 인프라 및 국산 컴퓨팅 호환성 강화
치푸(Zhipu)는 AI 인프라 기업인 XCore Sigma를 수억 위안 규모로 인수했다고 보도되었으며, 이는 기초 모델 엔지니어링, 국내 컴퓨팅 파워 호환성, 그리고 추론 최적화를 강화하는 조치이다.AI 이종 컴퓨팅 소프트웨어에 특화된 XCore Sigma는 중국과학원 계산연구소의 컴파일 기술을 기반으로 한 컴파일 기술에 중점을 두고 있다. 해당 팀은 로고손(Loongson), 신웨이(Shenwei), 캄브리콘(Cambricon), 그리고
DeepSeek, 3일간 서비스 중단… 10시간 넘게 지속; 관계자, 완전 복구 확인
중국을 대표하는 AI 기업인 딥시크(DeepSeek)는 3일 연속 발생한 예기치 못한 서비스 중단 사태 이후 서비스 안정성을 완전히 회복했다. 모니터링 데이터에 따르면, 3월 29일부터 31일까지 사용자들은 웹 채팅 플랫폼, 모바일 앱, API 인터페이스 전반에 걸쳐 연결 끊김 및 응답 지연 현상을 겪은 것으로 확인되었다.공식 상태 로그에 따르면, 각각 1





집






