{"as_of":"2026-08-10T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc25e6714a94f56e3dcf7d7e94ec0512d4decf016df56fa5b13f08302e571313","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:55:26.474627Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20645/citation-record","integrity":"/paper/2505.20645/integrity","json":"/paper/2505.20645/citation-record.json","paper":"/paper/2505.20645"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:23.031214Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.031214Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:f9d7be3327385477ec6def07ae9c1a127feea69c090e8cc335aa4858d099226e","observation_id":"3678a104-4fb6-4ba7-b583-62d3c55e9982","resolution":{"observed_at":"2026-08-07T13:55:23.031214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:23.164159Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.164159Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:f665294fffc54482dbaf8edc992ba871a9fd86e75cee6220692a16cbf8585080","observation_id":"9a2f5bd2-6d8e-49ac-a2a9-73bc4c4f41c6","resolution":{"observed_at":"2026-08-07T13:55:23.164159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:23.301304Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.301304Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:2d17180ec20660b9525c0e0b9de6b921ad953608f04f27e3ebad9e948f32c2e5","observation_id":"3d64b0ce-6a56-4875-93c3-e0152a72c205","resolution":{"observed_at":"2026-08-07T13:55:23.301304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00177","last_updated":"2025-02-28T20:43:45Z","snapshot_observed_at":"2026-08-09T09:17:21.863033Z","submitted_at":"2025-02-28T20:43:45Z","title":"Steering Large Language Model Activations in Sparse Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00177","snapshot_observed_at":"2026-08-07T13:55:23.396550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.396550Z"},"links":{"cited_paper":"/paper/2503.00177","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:27bbde5733662982631cd9fd2e5b536f757e6b2142249caf60b5fd569b5c0cc3","observation_id":"7fed5dda-db73-4f3a-b954-95000fee73a0","resolution":{"observed_at":"2026-08-07T13:55:23.396550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.924500Z","title":null,"venue":null,"work_id":"c8745b62-ccb7-4f73-af02-d2cae11873fb","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.469895Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:8092a5964eccee7d2cacac466a65e42de69e9ee9e3c5bd157a5d0f79f030537e","observation_id":"d1e4f3fd-8550-4f8f-8ff7-57771923261d","resolution":{"observed_at":"2026-08-07T13:55:28.967099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.685748Z","title":null,"venue":null,"work_id":"18a5f478-9e01-44c8-b6d5-33edfa7ffb89","year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.544602Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:02173e78132330074c3d0d4b8a8f759b682ef6396cb74c08bab70d5f446c0858","observation_id":"f4a29e80-2618-4887-a8af-bbaff5786fda","resolution":{"observed_at":"2026-08-07T13:55:28.779620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:23.646609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.646609Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:c84535422d54c8d910ac7e0d53738e540d1f9fcae02b4875fda2b537927079a3","observation_id":"03509357-a1a6-4528-88c9-eafe6a1bcaf0","resolution":{"observed_at":"2026-08-07T13:55:23.646609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11484","last_updated":"2025-01-10T02:18:01Z","snapshot_observed_at":"2026-08-09T23:59:00.360313Z","submitted_at":"2024-07-16T08:20:39Z","title":"The Oscars of AI Theater: A Survey on Role-Playing with Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11484","snapshot_observed_at":"2026-08-07T13:55:23.756147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.756147Z"},"links":{"cited_paper":"/paper/2407.11484","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:994d243f171524781bf1961e3d1d8beb730986e1864e8245d2198e7dffe88f02","observation_id":"6b99d4f3-d131-4f29-8441-94681a182eee","resolution":{"observed_at":"2026-08-07T13:55:23.756147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:23.877640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.877640Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:e9bdc194cf31f100e5d3d719145d2ae7f56ceb8a228c6803dd398b481cc44939","observation_id":"f0844eaf-74da-4531-84f5-26950888537f","resolution":{"observed_at":"2026-08-07T13:55:23.877640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.509905Z","title":null,"venue":null,"work_id":"dd6e2295-2497-4359-9863-060224edc219","year":2019},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:23.959641Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:461adfbc95c3b8960b3b5e713b484215e9d52784b31dd13bd0c297da15584129","observation_id":"9189b25b-60b9-4cc0-b65c-cbecb2670ef6","resolution":{"observed_at":"2026-08-07T13:55:28.571705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.021433Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.021433Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:9b2214a32d7eba8409c232fadc0144eca6e3978be10764ab91cf35c44b2b83a3","observation_id":"08ccbc95-eb83-45ba-835a-c09817365ff4","resolution":{"observed_at":"2026-08-07T13:55:24.021433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.320138Z","title":null,"venue":null,"work_id":"cb069434-5871-4c3b-a6dc-f49dfc0e399d","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.105466Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:d267b6c86974296f7bc2683142819f0d53949b2448a7574c028442fc9990df7b","observation_id":"f29105e1-6cb2-4ccb-ad53-eef96b8fe982","resolution":{"observed_at":"2026-08-07T13:55:28.402652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-07T13:55:24.177954Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.177954Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:921f385d59d7be3851f555c3e023d43a1aa20ddc6387f8920576736e9686ad3c","observation_id":"806d745c-ddd5-408f-82f9-1597793be352","resolution":{"observed_at":"2026-08-07T13:55:24.177954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.215136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.215136Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:b5d6572c8ae581ee23c188922d800326b7ee00013ed8ef4508366d60cab855d5","observation_id":"2bbf2f84-1d77-4032-956e-52218ecdd21e","resolution":{"observed_at":"2026-08-07T13:55:24.215136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.228724Z","title":"a m \\\"a l \\","venue":null,"work_id":"20331a72-44ba-45e5-b283-a89d3064985c","year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.265170Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:b0661c3f5f57c7b2cf110e45ffdca71a9378714848a0267e9df6aafc5054ade3","observation_id":"bd7f1696-27dc-478c-a417-f14fa3e506e5","resolution":{"observed_at":"2026-08-07T13:55:28.260944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15846","last_updated":"2024-06-18T13:16:36Z","snapshot_observed_at":"2026-08-03T19:57:23.894721Z","submitted_at":"2024-04-24T12:51:14Z","title":"From Complex to Simple: Enhancing Multi-Constraint Complex Instruction Following Ability of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15846","snapshot_observed_at":"2026-08-07T13:55:24.305287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.305287Z"},"links":{"cited_paper":"/paper/2404.15846","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:1a144b849efc088cb7d36b5881f21ff945d433e496a4c4aeb3ce85cbf1b7a15c","observation_id":"c524bf74-e85a-49cd-9876-4a8308cdcc8a","resolution":{"observed_at":"2026-08-07T13:55:24.305287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.371150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.371150Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:b194a748b9a033dd8b21e5ec7f23eb69b9b2bf113d0b5336f7480f69ee285729","observation_id":"d5c68d77-fab0-40a9-93df-378883fa50d9","resolution":{"observed_at":"2026-08-07T13:55:24.371150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.395","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:26.620587Z","title":null,"venue":null,"work_id":"a4e76a1f-be31-420d-8254-6150c2a45746","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.449316Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:34e816a080e9c82dffe2ae0c1add8ca6a1ceeb0ff4bc81cb6d6c05d8a427cb35","observation_id":"6829a3cd-4bac-4e58-a786-34465323e727","resolution":{"observed_at":"2026-08-07T13:55:26.696008Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:28.085703Z","title":"Aligning ai with shared human values","venue":null,"work_id":"f31f6056-f794-42fa-a1d6-e3cbdb3bf595","year":null},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.514927Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:df2be854c27aa13ff369b615eb9ca9de89ef79addb8b37cc5cfdd42534338232","observation_id":"341012a3-0db8-46d9-b2bb-bd601dab9778","resolution":{"observed_at":"2026-08-07T13:55:28.164053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.985088Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":"628485ca-95da-42d0-8a25-e5c8e1598630","year":2025},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.591601Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:ea8949e49917806de8dc6ca9bc0e72d072bb3e745f2f9dea5668cc6ded1c3a6c","observation_id":"0201ebbc-74d1-4525-8e8c-ce6b79439072","resolution":{"observed_at":"2026-08-07T13:55:28.021854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.666573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.666573Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:cd491fcbfd31b1a2329eb297288b03c6f8e0c6f7e4d3c15b29f1c86c6ded6820","observation_id":"142e94a9-8af7-4201-9cf1-f593f5170a7f","resolution":{"observed_at":"2026-08-07T13:55:24.666573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.764658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.764658Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:76ffdc313117dc7a61fdea85888bd431adf91678a1aa917d3567eb6e4b4865c0","observation_id":"320203d5-3a3e-43a3-bdeb-1b2f68262e7b","resolution":{"observed_at":"2026-08-07T13:55:24.764658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.859745Z","title":null,"venue":null,"work_id":"0f6fb302-112f-45f3-98af-44e8ea4ed98e","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.838996Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:bf8c77e1388052c785153ba283506f2af2498f026d6efca4d8a0b0b3f810c743","observation_id":"5a2905ac-aa31-4006-9fef-2a72a38038ad","resolution":{"observed_at":"2026-08-07T13:55:27.914835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:24.895883Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.895883Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:54ded8d53032f9c47db608e5511db3e03f8c7fb4a5c74c4c29e994094264314c","observation_id":"5172d1ae-6a34-446f-acd1-f875e135d0b8","resolution":{"observed_at":"2026-08-07T13:55:24.895883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.747492Z","title":null,"venue":null,"work_id":"8273269e-869e-44a2-86f8-57c605f10ddd","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:24.981143Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:3dbc9203cfc99109aa73de79f451f5bffe241920173cdd5d35166c8f6d90952d","observation_id":"f94c4197-7cfe-4008-8aa4-4fcea416ffd9","resolution":{"observed_at":"2026-08-07T13:55:27.796003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.063989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.063989Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:c6a6ddedef6c2457b6cdc978644ec73fbde7db59124626830221234ef32de356","observation_id":"10feda8b-dfb9-4b64-8be4-60d2c58ca271","resolution":{"observed_at":"2026-08-07T13:55:25.063989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.167622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.167622Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:e03432f656f23dc31684fd8fdb4f14e33e0f7d81965843d40dd88540c7c94b07","observation_id":"e153c7aa-c5c8-464e-9078-e319e3e12d75","resolution":{"observed_at":"2026-08-07T13:55:25.167622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.210926Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.210926Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:edcc24cb2064df3b3b4bfe82cb67ab11342705e851e92817835596ab229be6f7","observation_id":"ded4939f-32f4-4a99-b7e4-6b20b583700e","resolution":{"observed_at":"2026-08-07T13:55:25.210926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.275767Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.275767Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:26922c1f43f08a39705be40f8e821a89ab702b4a9d320c72ac44a4a11c539209","observation_id":"3d982a9b-72ab-4994-9114-23c61d3905ee","resolution":{"observed_at":"2026-08-07T13:55:25.275767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.347527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.347527Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:3297d24d2aa51db07a1efd34cffbcd33e4db0fc185a85ea96f83e1b7659fcac5","observation_id":"bbd91e97-fe96-4c32-8a49-1cc55e6f992f","resolution":{"observed_at":"2026-08-07T13:55:25.347527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.415397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.415397Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:3523476898a3db4a0d57c08e6ea9bc71848c75bca19d0c1fa414800c951610f0","observation_id":"bce8bca1-0acd-4c7e-973a-5fff009596c1","resolution":{"observed_at":"2026-08-07T13:55:25.415397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.490965Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.490965Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:700560b7c99faafefb5a498159beb9bd48539d27eb3d522de811d9c4adb4373c","observation_id":"77aa0b0c-fd8b-4f74-b852-c23db2761c7c","resolution":{"observed_at":"2026-08-07T13:55:25.490965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.537083Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.537083Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:774cbc5c38b5cc931eb7cffdfe7528872e2d0f4e7516070205b97ac6060be716","observation_id":"353ef87f-509a-4f8b-864f-aa2b54501e17","resolution":{"observed_at":"2026-08-07T13:55:25.537083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.607345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.607345Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:1ebc841dda984d485520c4d7a13b998afff6e89a166b00e406a27412018fbcfe","observation_id":"6f5adc31-3497-48aa-9acc-c271fc58ad3c","resolution":{"observed_at":"2026-08-07T13:55:25.607345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02823","last_updated":"2024-04-03T15:55:39Z","snapshot_observed_at":"2026-08-09T20:37:46.003467Z","submitted_at":"2024-04-03T15:55:39Z","title":"Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02823","snapshot_observed_at":"2026-08-07T13:55:25.697100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.697100Z"},"links":{"cited_paper":"/paper/2404.02823","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:d509105417268fda43b287a4375fc9213724ef6ab805de16adf44a828a830a2d","observation_id":"e52aa194-98a4-437f-a161-ffcdd34fb001","resolution":{"observed_at":"2026-08-07T13:55:25.697100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.774971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.774971Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:9f9b90b86824f63d2ca2c15f03a2b86dc4ad08717eb825196082a8ccec87f456","observation_id":"060c3749-cb58-417e-ab6d-95e70ad157ec","resolution":{"observed_at":"2026-08-07T13:55:25.774971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.821115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.821115Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:af32df95e54569043bc2cf9a5ebe60090c2e65d0f696c76284f93d44a7516cc2","observation_id":"a2682378-3c5c-4aae-b735-c460e0eb1941","resolution":{"observed_at":"2026-08-07T13:55:25.821115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.853785Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.853785Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:eb4b39ece45a8434f8081b8ba0197a0d6c6d4d1ce6c05dcf0dbc479f89db981d","observation_id":"3b542f9a-63ee-458e-804a-5d4cb0dda103","resolution":{"observed_at":"2026-08-07T13:55:25.853785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:25.908255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:25.908255Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:e9029eb8e4d9dbe41f59a91172c497b0ac2a3d4d1a89a922a957adb581197bc6","observation_id":"7f2e6fcc-87c9-4235-8cf4-4b186d2b7140","resolution":{"observed_at":"2026-08-07T13:55:25.908255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.604220Z","title":null,"venue":null,"work_id":"49828a64-8633-4a12-8653-26d951b6e43e","year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.012147Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:3da59b478c3f01e00eeacc5b0ca2a366b62b2b66c6473987f9461d9f7ecbcf83","observation_id":"9c1a650e-6a35-4559-a5cd-2d28fe02dd87","resolution":{"observed_at":"2026-08-07T13:55:27.657272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:26.074596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.074596Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:da4f362d68c58522d482edf39b5569e5323ba9161e321e884d0f718f54acefa9","observation_id":"cd076df4-4dea-48fc-95ff-a02506e5f376","resolution":{"observed_at":"2026-08-07T13:55:26.074596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:26.156757Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.156757Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:90cfafb89849246717dd0672f534c223522a52a1b905bd3e8d71a9b2711df283","observation_id":"96d78548-34e7-49c8-b13e-c72d4c514d40","resolution":{"observed_at":"2026-08-07T13:55:26.156757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:26.240689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.240689Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:25741064558ff34422fea5274fa4f20f971eb25217dd2256438cd7e4fe19088a","observation_id":"b4dfd2be-3187-4604-9d96-bade2c08ff9d","resolution":{"observed_at":"2026-08-07T13:55:26.240689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.467205Z","title":null,"venue":null,"work_id":"0a69c5df-3fe4-4b08-8249-350d1f5e2bbd","year":2025},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.293417Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:fcf510267a97cd868e6e0e0a92b25f519ceccc06e9532c31e53b4ea24458c4b8","observation_id":"87026bb3-9943-4c81-b678-b9266d4d4563","resolution":{"observed_at":"2026-08-07T13:55:27.529932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:27.345200Z","title":null,"venue":null,"work_id":"47b684c4-375b-407a-ae12-4ee00570d287","year":2025},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.380658Z"},"links":{"citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:6e885e6a5b20a6b8c3d4c12dd765e017c94e6b7a429015a9f581f0ec4695e816","observation_id":"bc408312-14ce-4608-afd9-4918149dbf08","resolution":{"observed_at":"2026-08-07T13:55:27.402408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T13:55:26.474627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:55:26.474627Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20645"},"observation_digest":"sha256:857592523e020e216fcfd89a014a3d4e3ed803c48537f5ede14ea8385e2cb487","observation_id":"46d49f00-0b25-4345-9b97-5c13ef782fda","resolution":{"observed_at":"2026-08-07T13:55:26.474627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20645","last_updated":"2025-06-04T06:18:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T09:18:05.111073Z","submitted_at":"2025-05-27T02:47:56Z","title":"STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.20645."}