{"as_of":"2026-08-09T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2023224f59ebf0cba1457ca3f4c86162b21169e84fd7f4f273d120148f3bce55","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T23:28:39.374084Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23394/citation-record","integrity":"/paper/2607.23394/integrity","json":"/paper/2607.23394/citation-record.json","paper":"/paper/2607.23394"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.270586Z","title":"Subliminal effects in your data: A general mechanism via log-linearity.arXiv preprint arXiv:2602.04863,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.270586Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:8ef7bb6f3c366733146d70d98ba15ae640ccf23312ce036e4376bc6710084e71","observation_id":"40a662bf-b9b9-4a3d-ae46-230c68fbbe31","resolution":{"observed_at":"2026-07-30T23:28:39.270586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.370114Z","title":"F Extended Related Work This appendix expands on the related work discussed in Section 2, giving per-reference detail that the main text compresses into citation clusters","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.370114Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:7462a9d5ae334fd1e675eee8f042c8ab5aad003fe87e3b3f0d323899509a769d","observation_id":"99d73c39-da88-49af-bda4-aae84707919a","resolution":{"observed_at":"2026-07-30T23:28:39.370114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.280326Z","title":"Weird generalization and inductive backdoors: New ways to corrupt LLMs.arXiv preprint arXiv:2512.09742,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.280326Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:dd1e66ca149e66cb313dbf84825ca3ae9dbfb31b33552e461f4dcb7d3d1bcf28","observation_id":"a5a971e3-6720-48fa-a07a-8bf66a695094","resolution":{"observed_at":"2026-07-30T23:28:39.280326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.284630Z","title":"Federico Bianchi, Mirac Suzgun, Giuseppe Attanasio, Paul R¨ ottger, Dan Jurafsky, Tatsunori Hashimoto, and James Zou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.284630Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:0f89ae49c583eef2c4a9be93ef3d5e6af3ca53ae8226a5ecbf89490c2cea704d","observation_id":"6ddcc00c-beba-4eb2-a907-5480828dd1f1","resolution":{"observed_at":"2026-07-30T23:28:39.284630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.293641Z","title":"James Flemings, Meisam Razaviyayn, and Murali Annavaram","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.293641Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:86f4834ee01acb614e421f14ddf08b4777c7b11b5d376029e6263fa860f2fbed","observation_id":"cf1efbe1-41e8-4cb7-a1c9-41c8b97edbea","resolution":{"observed_at":"2026-07-30T23:28:39.293641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.297970Z","title":"Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daum´ e III, and Kate Crawford","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.297970Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:a7ce97d9999ec84fa28aca5677b1b812dd5246b60cc033a3cd3c9f7c8e169db4","observation_id":"f2b83816-93ec-4c7b-aff3-61853b442d9c","resolution":{"observed_at":"2026-07-30T23:28:39.297970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11009","last_updated":"2024-06-25T22:35:07Z","snapshot_observed_at":"2026-08-07T08:56:19.559738Z","submitted_at":"2024-06-25T22:35:07Z","title":"CharED: Character-wise Ensemble Decoding for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11009","snapshot_observed_at":"2026-07-30T23:28:39.306715Z","title":"CharED: Character-wise ensemble decoding for large language models.arXiv preprint arXiv:2407.11009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.306715Z"},"links":{"cited_paper":"/paper/2407.11009","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:5d2713a72c7a8c0dc81eee4d42dc7a3a5cb47762245e26c1c2c151085089e089","observation_id":"d9103acd-4e18-4397-836f-4bcaf3d3e247","resolution":{"observed_at":"2026-07-30T23:28:39.306715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18299","last_updated":"2024-12-24T09:06:58Z","snapshot_observed_at":"2026-08-09T10:47:32.488794Z","submitted_at":"2024-12-24T09:06:58Z","title":"M-Ped: Multi-Prompt Ensemble Decoding for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18299","snapshot_observed_at":"2026-07-30T23:28:39.311232Z","title":"M-Ped: Multi-prompt ensemble decoding for large language models.arXiv preprint arXiv:2412.18299,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.311232Z"},"links":{"cited_paper":"/paper/2412.18299","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:d4168b6f2baa4cecff08bc8dba52f06b635eaa9f2131f0ab0b3fe9204a14950b","observation_id":"0009b72d-be7b-485f-80c6-7371802ebe9e","resolution":{"observed_at":"2026-07-30T23:28:39.311232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.09493","last_updated":"2026-05-09T05:13:52Z","snapshot_observed_at":"2026-07-06T22:35:37.039024Z","submitted_at":"2025-11-12T17:09:45Z","title":"Consensus Sampling for Safer Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.09493","snapshot_observed_at":"2026-07-30T23:28:39.315542Z","title":"Consensus sampling for safer generative ai.arXiv preprint arXiv:2511.09493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.315542Z"},"links":{"cited_paper":"/paper/2511.09493","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:971639069a0a82e69663634bc51705e8d555be3753f771e2cf8eb0552ba5d272","observation_id":"0e4f79b5-0d2b-4b20-993a-983f86dcd430","resolution":{"observed_at":"2026-07-30T23:28:39.315542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17139","last_updated":"2026-04-18T20:31:37Z","snapshot_observed_at":"2026-07-06T23:04:19.063534Z","submitted_at":"2026-04-18T20:31:37Z","title":"The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17139","snapshot_observed_at":"2026-07-30T23:28:39.328282Z","title":"The consensus trap: Rescuing multi-agent LLMs from adversarial majorities via token-level collaboration.arXiv preprint arXiv:2604.17139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.328282Z"},"links":{"cited_paper":"/paper/2604.17139","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:dbd1e5db37633c2778049c688118f362bfb3f7af83622be26673be60d6b8845b","observation_id":"bbb4fde2-dc8b-4dae-aeb9-ca22c48f2f61","resolution":{"observed_at":"2026-07-30T23:28:39.328282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.332376Z","title":"Semantic label smoothing for sequence to sequence problems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.332376Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:6c139611be382610c93c001ee09e61c22d12f872c27809cf9e7f718e706bebbe","observation_id":"9b3c2cee-17d0-4942-b4b4-5aba44ca460c","resolution":{"observed_at":"2026-07-30T23:28:39.332376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.344727Z","title":"Poisoning attacks on LLMs require a near-constant number of poison samples.arXiv preprint arXiv:2510.07192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.344727Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:336dadab9c410535ea608ea6e6de9f7a48c60a54083ece58ca884da7eb4f0d83","observation_id":"9f5ed6ba-307c-428b-9da2-3a8a46942fbe","resolution":{"observed_at":"2026-07-30T23:28:39.344727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.353058Z","title":"Semantic consensus decoding: Backdoor defense for verilog code generation.arXiv preprint arXiv:2602.04195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.353058Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:f41f43e2d8001af5a962f855b7210200a53d72ea04770928eeb9a60e75087fac","observation_id":"dad4ce71-68cf-4c83-b0c2-644a829f3cdb","resolution":{"observed_at":"2026-07-30T23:28:39.353058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11824","last_updated":"2024-05-20T15:38:28Z","snapshot_observed_at":"2026-07-06T14:45:22.954306Z","submitted_at":"2023-01-27T16:25:43Z","title":"PECAN: A Deterministic Certified Defense Against Backdoor Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11824","snapshot_observed_at":"2026-07-30T23:28:39.357218Z","title":"PECAN: A deterministic certified defense against backdoor attacks.arXiv preprint arXiv:2301.11824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.357218Z"},"links":{"cited_paper":"/paper/2301.11824","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:5d4bab86fc2f5c16340880cff88981d968f089bb477f3d28a5b330f84831baa5","observation_id":"1ed48157-b4e9-46da-b865-dd81b7fd75b7","resolution":{"observed_at":"2026-07-30T23:28:39.357218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.361809Z","title":"Nguyen, Yanhao Jia, Meihuizi Jia, Feng Yichao, and Anh Tuan Luu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.361809Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:4e75157c9c6062821b8b7aec50d50e25daec1083cdf9384196310fd5d819434c","observation_id":"2d3abc7f-cea7-4948-aa25-1ea00011a28e","resolution":{"observed_at":"2026-07-30T23:28:39.361809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.255","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"14 A Illustrative Examples: Two Disagreement Policies The following examples isolate the rules’ different responses to disputed mass","venue":null,"work_id":"df74b37d-6a7c-4be6-a6a4-6bec4586ce04","year":2025},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.365992Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:af0d0857f0a3e0227bfd45d048377513ae71b69cbc0ccf2191c6fb0a050e8790","observation_id":"ff484a4c-a556-4161-a0fa-24b6eacd34b8","resolution":{"observed_at":"2026-07-30T23:30:55.386353Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.374084Z","title":"These methods assign the models known roles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.374084Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:65630bd2d85bc31099dd7125b39af5c2aa37990270c007d4e4e9c54b9d513c8d","observation_id":"fe76ceb9-1007-404e-a215-1e462f555e24","resolution":{"observed_at":"2026-07-30T23:28:39.374084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03870","last_updated":"2024-08-27T08:31:04Z","snapshot_observed_at":"2026-07-06T17:40:33.769700Z","submitted_at":"2024-03-06T17:23:28Z","title":"Learning to Decode Collaboratively with Multiple Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03870","snapshot_observed_at":"2026-07-30T23:28:39.340462Z","title":"Learning to decode collaboratively with multiple language models.arXiv preprint arXiv:2403.03870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":1948,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.340462Z"},"links":{"cited_paper":"/paper/2403.03870","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:5be5418c82ce7ca8e8de23bedcff16b029b8502996db6f13455d2318a146a87f","observation_id":"0edff86b-d0fd-4f43-b954-97d849ed9dd5","resolution":{"observed_at":"2026-07-30T23:28:39.340462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.302112Z","title":"Mihnea Ghitu and Matthew Wicker","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.302112Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:ec99a9538d51996603e84c0965b4a90b484333a4fca863151fd0045294609e1c","observation_id":"e502ea8b-3b7d-4534-8f56-3502437509cc","resolution":{"observed_at":"2026-07-30T23:28:39.302112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-30T23:28:39.319846Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.319846Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:a9b8cbf3f102d80e67c6fc19c8a132e8762689c9bed7e91008794ee902754ea2","observation_id":"f9a58e69-f170-4373-9637-686a56d9c287","resolution":{"observed_at":"2026-07-30T23:28:39.319846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.336574Z","title":"Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok, Polina Petrova, Deepesh Suranjandass, and Donnie Winkelmann","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.336574Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:b0adc21b4b8373719fe3e213349760b5faba7c157615d163f936a0b5b210e1df","observation_id":"a04499f1-3eab-45ee-bb9f-9bbb0259f998","resolution":{"observed_at":"2026-07-30T23:28:39.336574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.324305Z","title":"CleanGen: Mitigating backdoor attacks for generation tasks in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.324305Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:a4dd804a576dda2868f8178d7bd714217d92f696240086af2cdf98588a793eba","observation_id":"f16eef63-1eca-495d-9cf8-cd172afb7a08","resolution":{"observed_at":"2026-07-30T23:28:39.324305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.289273Z","title":"Steering out-of-distribution generalization with concept ablation fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.289273Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:b442903fec739ad83842950b883ad953ccda92bba5fd7955401e293485fa42a3","observation_id":"724b73b5-7036-412f-ba9a-4594e92db310","resolution":{"observed_at":"2026-07-30T23:28:39.289273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T23:28:39.348678Z","title":"Certifiably robust RAG against retrieval corruption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.348678Z"},"links":{"citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:6968cdd1ad5ca1d0c7f937d9236a41827771c235f63860b5e9f42b6e8e37e9df","observation_id":"e71a4cfe-6c42-4eb0-8fb4-8d8f4227f606","resolution":{"observed_at":"2026-07-30T23:28:39.348678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07994","last_updated":"2026-05-08T16:50:25Z","snapshot_observed_at":"2026-08-07T07:45:17.138694Z","submitted_at":"2026-05-08T16:50:25Z","title":"Semantic Smoothing for Language Models via Distribution Estimation and Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07994","snapshot_observed_at":"2026-07-30T23:28:39.275525Z","title":"Semantic smoothing for language models via distribution estimation and embeddings.arXiv preprint arXiv:2605.07994,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-30T23:28:39.275525Z"},"links":{"cited_paper":"/paper/2605.07994","citing_paper":"/paper/2607.23394"},"observation_digest":"sha256:1ba51d9378ee315ce51e2e644a49bf285da7ea386a8e0111a2fd4ea963db6a53","observation_id":"d5c74ff8-21ea-43dc-ab00-e4736b340e36","resolution":{"observed_at":"2026-07-30T23:28:39.275525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23394","last_updated":"2026-07-25T23:41:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T06:31:18.035422Z","submitted_at":"2026-07-25T23:41:47Z","title":"Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.23394."}