A framework for mitigating malicious RLHF feedback in LLM training using consensus based reward

Z Zafaryab Haider M Md Hafizur Rahman V Vijay Devabhaktuni S Shane Moeykens P Prabuddha Chakraborty

Article Details

Volume / Issue Vol. 15, Issue 1
Published March 17, 2025
ISSN 2045-2322
Publisher Nature Portfolio

Journal Info

Scientific Reports

Nature Portfolio

ISSN: 2045-2322 Open Access Life Sciences

Authors (5)

Z

Zafaryab Haider

M

Md Hafizur Rahman

V

Vijay Devabhaktuni

S

Shane Moeykens

P

Prabuddha Chakraborty