@misc{arxiv2610.02586, title = {{Labels Override Definitions in Jev-Style Typed Decision Models}}, author = {Unknown}, year = {2026}, eprint = {2610.02586}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.02586}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2606.23130, title = {{Understanding the (In)Security of Vibe-Coded Applications}}, author = {Unknown}, year = {2026}, eprint = {2606.23130}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.23130}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04195, title = {{MemLeak}}, author = {Unknown}, year = {2026}, eprint = {2610.04195}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04195}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07639, title = {{HarnessSecurity-Bench: Do Security Mechanisms Really Protect Coding Agent Harnesses?}}, author = {Unknown}, year = {2026}, eprint = {2610.07639}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07639}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2606.05647, title = {{Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?}}, author = {Unknown}, year = {2026}, eprint = {2606.05647}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.05647}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06001, title = {{AgentSpy: Making AI Agent Behavior Observable}}, author = {Unknown}, year = {2026}, eprint = {2610.06001}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06001}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07723, title = {{Answer-side backdoor}}, author = {Unknown}, year = {2026}, eprint = {2610.07723}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07723}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06191, title = {{Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions}}, author = {Unknown}, year = {2026}, eprint = {2610.06191}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06191}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08559, title = {{Latent space bias directions in LLMs capture confidence, not fairness}}, author = {Stephanie Buttigieg and Maeve Madigan and Parameswaran Kamalaruban and Stuart Burrell}, year = {2026}, eprint = {2610.08559}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08559}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08670, title = {{Principled Under Pressure: Post-Training Decides Whether LLMs Act on Their Own Moral Judgment}}, author = {Orion Reblitz-Richardson}, year = {2026}, eprint = {2610.08670}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08670}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07510, title = {{PersistBD}}, author = {Unknown}, year = {2026}, eprint = {2610.07510}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07510}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07089, title = {{Towards a Unified Misuse Monitoring Benchmark}}, author = {Unknown}, year = {2026}, eprint = {2610.07089}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07089}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07274, title = {{A Trust Layer for Agent Evaluation}}, author = {Unknown}, year = {2026}, eprint = {2610.07274}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07274}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06898, title = {{DIBench}}, author = {Unknown}, year = {2026}, eprint = {2610.06898}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06898}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04378, title = {{COPEX}}, author = {Unknown}, year = {2026}, eprint = {2610.04378}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04378}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08540, title = {{Toward Alignment Scaling Laws}}, author = {Unknown}, year = {2026}, eprint = {2610.08540}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08540}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07359, title = {{Evaluate the Stack}}, author = {Unknown}, year = {2026}, eprint = {2610.07359}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07359}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07645, title = {{SkillPoison}}, author = {Unknown}, year = {2026}, eprint = {2610.07645}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07645}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06966, title = {{APEX: Active Protection at Execution Boundaries for LLM Agents}}, author = {Xinran Zheng and Xin Fan Guo and Zhiqiang Hao and Fan Yang and Xingzhi Qian and Jiawei Du and Jinfeng Xu and Zheng Xing and Shuo Yang and Xingjun Wang}, year = {2026}, eprint = {2610.06966}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06966}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05453, title = {{The Poisoned Conversation}}, author = {Unknown}, year = {2026}, eprint = {2610.05453}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05453}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05830, title = {{HAL}}, author = {Unknown}, year = {2026}, eprint = {2610.05830}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05830}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08098, title = {{Surviving the Router}}, author = {Unknown}, year = {2026}, eprint = {2610.08098}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08098}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07654, title = {{Does On-Policy Distillation for Safety Pose Backdoor Risks?}}, author = {Unknown}, year = {2026}, eprint = {2610.07654}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07654}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04699, title = {{CoVer}}, author = {Unknown}, year = {2026}, eprint = {2610.04699}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04699}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2608.17776, title = {{Debate Training Reduces Reward Hacking in RLAIF}}, author = {Unknown}, year = {2026}, eprint = {2608.17776}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.17776}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2609.38948, title = {{DrivingBench: Can Vision-Language Models Drive a Toyota Corolla?}}, author = {Aditya Ramabadran}, year = {2026}, eprint = {2609.38948}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2609.38948}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07518, title = {{TRACE}}, author = {Unknown}, year = {2026}, eprint = {2610.07518}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07518}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07125, title = {{PEV}}, author = {Unknown}, year = {2026}, eprint = {2610.07125}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07125}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07935, title = {{SIGMA}}, author = {Unknown}, year = {2026}, eprint = {2610.07935}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07935}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04907, title = {{Why Subliminal Learning Needs So Much Data: A Noisy Inverse View through Steering Vector Recovery}}, author = {Unknown}, year = {2026}, eprint = {2610.04907}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04907}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08240, title = {{Newer and Bigger, but Safer?}}, author = {Unknown}, year = {2026}, eprint = {2610.08240}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08240}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06824, title = {{TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts}}, author = {Unknown}, year = {2026}, eprint = {2610.06824}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06824}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2609.38972, title = {{Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment}}, author = {Unknown}, year = {2026}, eprint = {2609.38972}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2609.38972}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07722, title = {{Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods}}, author = {Haotian Yang and Huikang Jiang and Yucheng Wu and Wen-Jie Jiang and Chenpeng Wang and Yibin Lou and Liangming Pan}, year = {2026}, eprint = {2610.07722}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07722}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07009, title = {{Which Image Property Carries the Jailbreak? A Controlled Dissection of Image-to-Text Jailbreaks}}, author = {Boyuan Chen and Yehia Dawoud and Hailemariam Mersha and Minghao Shao and Siddharth Garg and Ramesh Karri and Muhammad Shafique}, year = {2026}, eprint = {2610.07009}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07009}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08668, title = {{Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents}}, author = {Unknown}, year = {2026}, eprint = {2610.08668}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08668}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04737, title = {{PyINE}}, author = {Unknown}, year = {2026}, eprint = {2610.04737}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04737}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07753, title = {{From Evidence to Action: How Tool-Using Agents Fail}}, author = {Unknown}, year = {2026}, eprint = {2610.07753}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07753}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08678, title = {{Secure Speculative Decoding for Large Language Models}}, author = {Yichi Zhang and Zhiqi Wang and Neil Gong and Yuchen Yang}, year = {2026}, eprint = {2610.08678}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08678}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07570, title = {{Unanimously Wrong}}, author = {Unknown}, year = {2026}, eprint = {2610.07570}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07570}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2609.39518, title = {{Referential Uncertainty in Human–AI Collaboration}}, author = {Christian Poelitz; Finale Doshi-Velez; Siân Lindley}, year = {2026}, eprint = {2609.39518}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2609.39518}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2601.22169, title = {{In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement}}, author = {Unknown}, year = {2026}, eprint = {2601.22169}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.22169}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08364, title = {{Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations}}, author = {Toby D. Pilditch}, year = {2026}, eprint = {2610.08364}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08364}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04184, title = {{EvalResearchBench}}, author = {Unknown}, year = {2026}, eprint = {2610.04184}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04184}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2602.24210, title = {{From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves}}, author = {Haritz Puerto; Haonan Li; Xudong Han; Timothy Baldwin; Iryna Gurevych}, year = {2026}, eprint = {2602.24210}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.24210}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07967, title = {{DecepEval}}, author = {Unknown}, year = {2026}, eprint = {2610.07967}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07967}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07476, title = {{Can Power Draw Constrain Covert Compute?}}, author = {Unknown}, year = {2026}, eprint = {2610.07476}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07476}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07791, title = {{Illusory Pattern Perception Drives Spurious Inference in Large Language Models}}, author = {Peihua Mai and Zhuoyan Shao and Xinbao Qiao and Meng Zhang and Xinyue Zhou and Yan Pang}, year = {2026}, eprint = {2610.07791}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07791}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08662, title = {{ParanoiaEval: Benchmarking Unnecessary Defensive Work in Agentic Coding}}, author = {Unknown}, year = {2026}, eprint = {2610.08662}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08662}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06163, title = {{SAGE}}, author = {Unknown}, year = {2026}, eprint = {2610.06163}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06163}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06903, title = {{Component and Dimension Sparsity in Transformer Refusal Mechanisms}}, author = {Vincent Siu and Glenn Grant-Richards and Vlad Pavlovich and Yizhou Sun and Dawn Song and Chenguang Wang}, year = {2026}, eprint = {2610.06903}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06903}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08178, title = {{On the Intrinsic Limited Robustness of Latent-Based Watermarking}}, author = {Unknown}, year = {2026}, eprint = {2610.08178}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08178}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05246, title = {{What a Policy Gate Can and Cannot Know: Measured Boundaries of Cross-Platform Command Adjudication}}, author = {Unknown}, year = {2026}, eprint = {2610.05246}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05246}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07389, title = {{Inference and learning in sparse autoencoders as natural gradient flow}}, author = {Hadi Vafaii and Tejas Rao and David Chanin and Thomas Fel and Jacob L. Yates and Bruno Olshausen and David Klindt and Dileep George and Miguel L\'azaro-Gredilla}, year = {2026}, eprint = {2610.07389}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07389}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08585, title = {{Incidental information contaminates patient notes and disrupts clinical reasoning in LLMs}}, author = {Unknown}, year = {2026}, eprint = {2610.08585}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08585}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08773, title = {{AdvSim2Real}}, author = {Unknown}, year = {2026}, eprint = {2610.08773}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08773}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08791, title = {{World Models' Last Exam in Physics}}, author = {Unknown}, year = {2026}, eprint = {2610.08791}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08791}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07005, title = {{Where Does the Audio Jailbreak Live? A Controlled Frequency-Depth Audit of AdvWave-P on Qwen2-Audio}}, author = {Boyuan Chen and Minseok Kim and Sohaila Abdulsattar and Minghao Shao and Siddharth Garg and Ramesh Karri and Muhammad Shafique}, year = {2026}, eprint = {2610.07005}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07005}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05140, title = {{AutoSciBench: Autonomous Benchmark Generation for Evaluating Scientific Agents}}, author = {Unknown}, year = {2026}, eprint = {2610.05140}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05140}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.01218, title = {{AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation}}, author = {Unknown}, year = {2026}, eprint = {2610.01218}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.01218}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08048, title = {{DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks}}, author = {Unknown}, year = {2026}, eprint = {2610.08048}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08048}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04975, title = {{Runtime Authorization of Self-Generated Subgoals in Long-Horizon Tool-Using AI Agents}}, author = {Unknown}, year = {2026}, eprint = {2610.04975}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04975}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07469, title = {{COMPASS: Finding Where Reasoning Lives in Language Models}}, author = {Pratyay Dutta and Kowshik Thopalli and Vivek Narayanaswamy}, year = {2026}, eprint = {2610.07469}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07469}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08554, title = {{Systemization of Knowledge (SoK): Human-Centered AI Safety for Youth}}, author = {Unknown}, year = {2026}, eprint = {2610.08554}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08554}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07762, title = {{ES-Trace: Auditing Ethical-Sourcing Disclosure of Code Generation Models Beyond Model Cards}}, author = {Unknown}, year = {2026}, eprint = {2610.07762}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07762}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04426, title = {{UnAct: Gradient-Free Unlearning via Targeted Activation Intervention}}, author = {Unknown}, year = {2026}, eprint = {2610.04426}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04426}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07362, title = {{Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints}}, author = {Shai Feldman and Yaniv Romano}, year = {2026}, eprint = {2610.07362}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07362}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06977, title = {{Visual-Invariance-Augmented Feature Optimal Alignment for Transferable Adversarial Attacks against Closed-Source MLLMs}}, author = {Xiaojun Jia and Simeng Qin and Yiming Li and Jie Liao and Sensen Gao and Ke Ma and Yang Liu and Xiaochun Cao}, year = {2026}, eprint = {2610.06977}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06977}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08061, title = {{ASCENT: First-Order Optimal Fine-Tuning with Recalibration for Safety--Utility Co-Enhancement}}, author = {Weiwei Qi and Chongyu Wang and Tianhang Zheng and Zefeng Wu and Zhilin Guo and Xiaojun Jia and Zhongjie Ba and Kui Ren}, year = {2026}, eprint = {2610.08061}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08061}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07519, title = {{Not What a Child Expressed}}, author = {Unknown}, year = {2026}, eprint = {2610.07519}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07519}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07459, title = {{Auditable Claims about AI Agents}}, author = {Unknown}, year = {2026}, eprint = {2610.07459}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07459}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08331, title = {{Transferable Spatial Temporal Coherence Adversarial Attack on Black-Box Vision Language Models for Autonomous Driving}}, author = {Unknown}, year = {2026}, eprint = {2610.08331}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08331}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.00417, title = {{Source Identification Is Not Fitness Testing: Measuring the Limits of Synthetic-Data Attribution}}, author = {Unknown}, year = {2026}, eprint = {2610.00417}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.00417}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2603.01544, title = {{RA-Det: Towards Universal Detection of AI-Generated Images via Robustness Asymmetry}}, author = {Yunhao Chen}, year = {2026}, eprint = {2603.01544}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.01544}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07774, title = {{Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models}}, author = {Ziyuan Yang and Wenxuan Ding and Shangbin Feng and Yulia Tsvetkov}, year = {2026}, eprint = {2610.07774}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07774}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07657, title = {{DEFER1}}, author = {Unknown}, year = {2026}, eprint = {2610.07657}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07657}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06950, title = {{Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering}}, author = {Ran Li and Lei Chen}, year = {2026}, eprint = {2610.06950}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06950}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08552, title = {{AnyBottle: A Recipe to Only Keep the Concepts You Really Need}}, author = {Wolfgang Stammer and Sukrut Rao and Hevra Petekkaya and David Steinmann and Bernt Schiele}, year = {2026}, eprint = {2610.08552}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08552}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08577, title = {{How Learning Governs Unlearning across the Memorization-Generalization Spectrum}}, author = {Hwiyeong Lee and Hyelim Lim and Ingyu Bang and Hoki Kim and Taeuk Kim}, year = {2026}, eprint = {2610.08577}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08577}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07256, title = {{Efficient Auditing of Adversarial AI Agent Behavior from Agent Traces}}, author = {Unknown}, year = {2026}, eprint = {2610.07256}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07256}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2609.34227, title = {{When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model}}, author = {Unknown}, year = {2026}, eprint = {2609.34227}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2609.34227}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08761, title = {{VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning}}, author = {Unknown}, year = {2026}, eprint = {2610.08761}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08761}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.06945, title = {{Beyond the Linear Representation Hypothesis: Non-Linear Activation Steering in Text-to-Image Models}}, author = {Muhammad Atif Butt and Pawe\l Skier\'s and Joost Van De Weijer and Kamil Deja}, year = {2026}, eprint = {2610.06945}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.06945}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08571, title = {{RAG-PIBench: A Leakage-Aware Benchmark for Prompt-Injection Detection in Trustworthy RAG Systems}}, author = {Niveen O. Jaffal and Ahmet Yuksel and David Mohaisen}, year = {2026}, eprint = {2610.08571}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08571}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05166, title = {{A Safe Action Is Not Enough: Feasible-Future Decoding for Vision-Language-Action Policies}}, author = {Unknown}, year = {2026}, eprint = {2610.05166}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05166}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07023, title = {{Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment}}, author = {Jinghao Pang and Jitai Hao and Qiang Huang and Zhaochun Ren and Jun Yu}, year = {2026}, eprint = {2610.07023}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07023}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07532, title = {{Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge}}, author = {Wonjun Lee and Kyungsik Yang and Gaeun Ji and Vaidehi Patil and Haon Park and Bumsub Ham and Mohit Bansal and Suhyun Kim}, year = {2026}, eprint = {2610.07532}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07532}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08316, title = {{MARCO: The Radioactive Watermark for Protein Generative Models}}, author = {Unknown}, year = {2026}, eprint = {2610.08316}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08316}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07403, title = {{Defense-in-Depth for LLMs: Evaluating Memory Gates Against Activation-Induced and Memory-Induced Sycophancy}}, author = {Ritvij Sharma and Russell Dlugosz and Ryan Zhou and Maheep Chaudhary}, year = {2026}, eprint = {2610.07403}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07403}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07583, title = {{Mechanistic Interpretability of Atmospheric Rivers in GraphCast}}, author = {Madelyn Mathai and Timothy B. Higgins and Kevin M. Grise and Chirag Agarwal and Antonios Mamalakis}, year = {2026}, eprint = {2610.07583}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07583}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07323, title = {{ATLAS-AL: Adaptive Trust-Region for Latent Adversarial Searches via Active Learning}}, author = {Marsalis Gibson and Claire Tomlin and Shankar Sastry}, year = {2026}, eprint = {2610.07323}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07323}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.07386, title = {{NetAgent: Multi-Task Agentic Network Traffic Analysis Made Practical}}, author = {Hao Fu and Dawn Song and Peng Gao}, year = {2026}, eprint = {2610.07386}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.07386}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08630, title = {{Towards In-Parameter Memory Augmentation for Large Language Models}}, author = {Haoyu Huang and Zhongwei Xie and Jiaxin Bai and Yisen Gao and Hong Ting Tsang and Wuganjing Song and Huihao Jing and Yufei Li and Yangqiu Song}, year = {2026}, eprint = {2610.08630}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08630}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.08082, title = {{POLAR: Ontology-Guided Risk Prevention for Tool-Calling LLM Agents}}, author = {Unknown}, year = {2026}, eprint = {2610.08082}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.08082}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.05898, title = {{Collaborative Personalized Preference Alignment for LLMs under Data Deficiency}}, author = {Unknown}, year = {2026}, eprint = {2610.05898}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.05898}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04749, title = {{Agentic discovery of blood biomarker from distilled private health records}}, author = {Unknown}, year = {2026}, eprint = {2610.04749}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04749}, note = {AI Safety HOT 2026-10-07} } @misc{arxiv2610.04605, title = {{ConEx: Human-Interpretable Saliency Maps via Concept-Aware Attribution}}, author = {Unknown}, year = {2026}, eprint = {2610.04605}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2610.04605}, note = {AI Safety HOT 2026-10-07} }