M

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang의 전문분석자료

Academic · 약 1분

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

arXiv:2604.00012v1 Announce Type: cross Abstract: Despite the impressive performance of general-purpose large language models (LLMs), they often require fine-tuning or post-training to excel at specific …

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang
조회수 39회