{"as_of":"2026-08-11T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b2942aaf250813b5b6c54d473b0f648a02129bbf5d846e4a4d009a1381da589","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:26:22.907922Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T02:32:49.034790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"cited_work":{"arxiv_id":"2507.15974","doi":"10.48550/arxiv.2507.15974","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wang and Weichen Yu and Chawin Sitawarin and Vikash Sehwag and Prateek Mittal , title =","venue":"ArXiv.org","work_id":"6c7cdc5c-54da-48c8-a182-a844d7756516","year":2025},"citing_paper":{"arxiv_id":"2605.20286","last_updated":"2026-05-19T06:11:04Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T06:11:04Z","title":"Adaptive Probe-based Steering for Robust LLM Jailbreaking","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-21T02:32:49.034790Z"},"links":{"cited_paper":"/paper/2507.15974","citing_paper":"/paper/2605.20286"},"observation_digest":"sha256:2d8fb14442d31169abe65603fc860f5fbf4b4a935894b73dcec2f6a9065ad5f9","observation_id":"026b3643-7260-481c-8717-988f3de28d2c","resolution":{"observed_at":"2026-05-21T02:33:54.907156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15974/citation-record","integrity":"/paper/2507.15974/integrity","json":"/paper/2507.15974/citation-record.json","paper":"/paper/2507.15974"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T15:26:19.829032Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.829032Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:7cce148caa3857aa054c666fd2786b4f69ada4196a23f863ffcd235fda1242d1","observation_id":"9982772f-ef9e-4a0b-a257-3c77f1f215de","resolution":{"observed_at":"2026-08-06T15:26:19.829032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-06T15:26:20.051022Z","title":"Brown, Nicholas Joseph, Sam McCandlish, Christopher Olah, Jared Kaplan, and Jack Clark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.051022Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:ea1e9104f4e607ef3613256ff7829292b1a2964e7c34bd8097e7227a99d0c6a1","observation_id":"9cb1b559-ab18-4b7b-9095-be7da16f85f2","resolution":{"observed_at":"2026-08-06T15:26:20.051022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-06T15:26:20.117161Z","title":"Zhibin Gou, Zhihong Shao, Yeyun Gong, Yelong Shen, Yujiu Yang, Minlie Huang, Nan Duan, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.117161Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:cc48cf462b7e2172e940f7f937e0a1d1de5da2b01d0174b380b1d5d590b2de54","observation_id":"8841390c-91ff-4d0e-a924-f0ef47f607be","resolution":{"observed_at":"2026-08-06T15:26:20.117161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:20.188675Z","title":"org/abs/2506.15674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.188675Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:72ee3890f6f7b6a7f44a2be8f49cf02e829f2242c7eadfe62706ebb4608696c5","observation_id":"8417ebd9-59b6-4aa6-b8fa-646522081d01","resolution":{"observed_at":"2026-08-06T15:26:20.188675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:26:20.346907Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.346907Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:c0bc40cfbe969a4f4dfccb6a4dcab6d2b93541ae01922bfae14312e36adb90fc","observation_id":"ce9ddaa7-5fae-4fa2-824c-2542d8430729","resolution":{"observed_at":"2026-08-06T15:26:20.346907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T15:26:20.417484Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.417484Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:44df8421a72073445c6ca64042e4dfa82ee0fd60088b471e3aecf2ce84e4fce9","observation_id":"a75f6f51-0fb7-481f-8422-f5fe79d0a145","resolution":{"observed_at":"2026-08-06T15:26:20.417484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-10T22:18:09.505446Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-06T15:26:20.476585Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.476585Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:d6fef61d355339d6f605774c3366a5c88eab82497d1a34ac573f7fc934ac6993","observation_id":"785f0dd7-84af-428d-90f6-45692600b60a","resolution":{"observed_at":"2026-08-06T15:26:20.476585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T15:26:20.542266Z","title":"Search- r1: Training llms to reason and leverage search engines with reinforcement learning.ArXiv, abs/2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.542266Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:a9be7590f812c9b2628ab74e826195208a06ddc15a0f2fbb263b8013a7c0be5a","observation_id":"5d37befe-25be-47b2-9984-2d4825deed40","resolution":{"observed_at":"2026-08-06T15:26:20.542266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T15:26:20.640185Z","title":"Martin Kuo, Jianyi Zhang, Aolin Ding, Qinsi Wang, Louis DiValentin, Yujia Bao, Wei Wei, Hai Li, and Yiran Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.640185Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:8b9fb4487b69c64d277d98ea83e7b859915cd2d780c13aa443feb6df44f028fe","observation_id":"190ac5e0-6c50-4b7e-b6b9-841f8408844a","resolution":{"observed_at":"2026-08-06T15:26:20.640185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04625","last_updated":"2025-03-07T18:13:22Z","snapshot_observed_at":"2026-08-07T17:24:07.321477Z","submitted_at":"2025-03-06T17:11:51Z","title":"START: Self-taught Reasoner with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04625","snapshot_observed_at":"2026-08-06T15:26:20.726516Z","title":"Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.726516Z"},"links":{"cited_paper":"/paper/2503.04625","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:c930b4bfb122f11b459de9fff929ec0b88a16276234fcd7d350d070b8abb9d2c","observation_id":"6bb401ba-6a7d-4b8e-9227-e3c5f6ffbc8d","resolution":{"observed_at":"2026-08-06T15:26:20.726516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:20.812119Z","title":"Deepseek-r1 thoughtology: Let’s think about llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.812119Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:ae966c27ad70c1dcf4843d4e1f5bb9c2f2a184e13049b55d3c7bb20556ffb3a9","observation_id":"95143e5e-7b84-4c41-a28c-302303f4f8ca","resolution":{"observed_at":"2026-08-06T15:26:20.812119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09420","last_updated":"2025-04-13T03:36:06Z","snapshot_observed_at":"2026-08-10T13:19:37.675819Z","submitted_at":"2025-04-13T03:36:06Z","title":"SaRO: Enhancing LLM Safety through Reasoning-based Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09420","snapshot_observed_at":"2026-08-06T15:26:20.968631Z","title":"Saro: Enhancing llm safety through reasoning-based alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.968631Z"},"links":{"cited_paper":"/paper/2504.09420","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:76da88426777f4647b0ad7d71fcd1a27b87cbc53cbc2bd2dd3606061a5be5c12","observation_id":"dabc4faf-01cc-42a2-a2a3-0011ce77004e","resolution":{"observed_at":"2026-08-06T15:26:20.968631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:26:21.053444Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.053444Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:127af715f46148936afd8b5dc3a84442f4965031c7e7d783dd9457e74d882bbd","observation_id":"47269b30-f004-490a-a72c-d33a882633a6","resolution":{"observed_at":"2026-08-06T15:26:21.053444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T15:26:21.122575Z","title":"net/forum?id=qzEzXnw4ng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.122575Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:ccf8a466d83fcceeb1bfdf98a22149da6156a6aa62002758e5ef6d1f429736f3","observation_id":"ed13eb12-23ff-46ad-8414-828b4f8a9d4e","resolution":{"observed_at":"2026-08-06T15:26:21.122575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-06T15:26:21.218421Z","title":"R1-searcher: Incentivizing the search capability in llms via re- inforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.218421Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:42e8ec413f1e523e3dd9f78b4c9c806eff6082c8c823597a5347cd0aa024923d","observation_id":"c93cf7cc-4420-49af-a43e-3dc3d2457b82","resolution":{"observed_at":"2026-08-06T15:26:21.218421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-10T04:45:11.275468Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-06T15:26:21.270522Z","title":"net/forum?id=fsW7wJGLBd","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.270522Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:5d6f498be83101c29ea382106e028a6b73ed28bda7d25e2a7b6df5e42f43040c","observation_id":"41bb8317-881a-4f74-93a2-718796aefabe","resolution":{"observed_at":"2026-08-06T15:26:21.270522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17704","last_updated":"2025-05-24T12:50:56Z","snapshot_observed_at":"2026-08-07T15:59:26.458348Z","submitted_at":"2025-04-24T16:11:01Z","title":"Safety in Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17704","snapshot_observed_at":"2026-08-06T15:26:21.358800Z","title":"Safety in large reasoning models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.358800Z"},"links":{"cited_paper":"/paper/2504.17704","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:8c1ff5ece6f4b07e211defe9391ed9fa20df5026f31fbab7fd842dad5ec62936","observation_id":"c2fb6f89-a64b-4de4-8f05-950781929a9e","resolution":{"observed_at":"2026-08-06T15:26:21.358800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:21.479404Z","title":"Star-1: Safer alignment of reasoning llms with 1k data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.479404Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:4ae0945921b5ce8a34087165510ab8186a8bc0756d074e7b9f7870c99d0de752","observation_id":"157d35bb-6d66-4e12-92df-7ea7156ebf16","resolution":{"observed_at":"2026-08-06T15:26:21.479404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24370","last_updated":"2025-05-21T17:51:27Z","snapshot_observed_at":"2026-08-07T16:20:08.878901Z","submitted_at":"2025-03-31T17:50:13Z","title":"Effectively Controlling Reasoning Models through Thinking Intervention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24370","snapshot_observed_at":"2026-08-06T15:26:21.597162Z","title":"Autogen: Enabling next-gen llm applica- tions via multi-agent conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.597162Z"},"links":{"cited_paper":"/paper/2503.24370","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:3f0c759d6816586c9b16b8406ab89015e79a9b5fa181b4fe7e92b09b717acbf4","observation_id":"c7898956-3875-476d-9020-8fd8c11592cb","resolution":{"observed_at":"2026-08-06T15:26:21.597162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T15:26:21.750058Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.750058Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:07afc20901792ee1719c3c15746ae3589128766248b45de46a87e5a14d752dfd","observation_id":"402c6651-5ef4-42f9-9eaa-dfbd928f89b0","resolution":{"observed_at":"2026-08-06T15:26:21.750058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-08-10T23:28:14.284078Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-06T15:26:21.912851Z","title":"Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag, Kaixuan Huang, Luxi He, Boyi Wei, Dacheng Li, Ying Sheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:21.912851Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:fdc8b8499329a41c02625e352a66147f9b3e5e050be9655c29a791c08a59f3fe","observation_id":"333ca84c-6509-48c8-a1da-bbe269f53930","resolution":{"observed_at":"2026-08-06T15:26:21.912851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T15:26:22.109737Z","title":"Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Tom Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.109737Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:65773bdf2e81663e32ca6306b3a134ce666208f0ae613d8507b7a995a6f2edf2","observation_id":"16badb67-6dc0-4516-99f2-d6926619ca6a","resolution":{"observed_at":"2026-08-06T15:26:22.109737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15806","last_updated":"2025-06-03T14:35:59Z","snapshot_observed_at":"2026-08-07T18:06:28.819161Z","submitted_at":"2025-02-19T07:23:36Z","title":"A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15806","snapshot_observed_at":"2026-08-06T15:26:22.339685Z","title":"A mousetrap: Fooling large reasoning models for jailbreak with chain of iterative chaos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.339685Z"},"links":{"cited_paper":"/paper/2502.15806","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:3fc2a6ad4b50373a40911f1293152ebd5fe747321642900c3226a597c66a8e0a","observation_id":"a9d9edf9-7a4c-42c1-a5b5-0a423b16bca3","resolution":{"observed_at":"2026-08-06T15:26:22.339685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18841","last_updated":"2025-01-31T01:20:44Z","snapshot_observed_at":"2026-08-10T14:48:26.015156Z","submitted_at":"2025-01-31T01:20:44Z","title":"Trading Inference-Time Compute for Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18841","snapshot_observed_at":"2026-08-06T15:26:22.432003Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.432003Z"},"links":{"cited_paper":"/paper/2501.18841","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:2667d47889a3d5a5a2b40f64c154cd1b667c8381133e843681bc20868caf4368","observation_id":"8404eecd-d58e-467f-ad4d-29ee522e8a54","resolution":{"observed_at":"2026-08-06T15:26:22.432003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10081","last_updated":"2025-04-14T10:26:37Z","snapshot_observed_at":"2026-08-07T16:05:57.274080Z","submitted_at":"2025-04-14T10:26:37Z","title":"RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10081","snapshot_observed_at":"2026-08-06T15:26:22.599759Z","title":"Realsafe- r1: Safety-aligned deepseek-r1 without compromising reasoning capability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.599759Z"},"links":{"cited_paper":"/paper/2504.10081","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:675826de9a5860c95b1673254e2c26e401465180c87bb48d988153e9ea05f657","observation_id":"14fa33a6-25c9-4749-b8f2-378c165ee02b","resolution":{"observed_at":"2026-08-06T15:26:22.599759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-06T23:53:10.606737Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-06T15:26:22.673177Z","title":"Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, and Yu-Xiong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.673177Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:191f9446d61f519c3bd84282116ab09f45fab246ed9be83f2b080f2f83ad679f","observation_id":"4a9fc1eb-2807-4103-96d4-9595684e0300","resolution":{"observed_at":"2026-08-06T15:26:22.673177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:22.727553Z","title":"The hidden risks of large reasoning models: A safety assessment of r1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.727553Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:f035752c00da8ee7de322331276835699319bf76f6aa2a2f136a0b974785e9db","observation_id":"1d5034c9-425f-4991-a90b-d3e295c21f02","resolution":{"observed_at":"2026-08-06T15:26:22.727553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.216093Z","title":"13 Preprint","venue":null,"work_id":"23934d73-5f4c-49de-96ae-eb95ed024015","year":2025},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.800518Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:ee0e786b28fb19b3e493c799b7b8967e81e50f6ab7eba2fb4f71af674dd05fe5","observation_id":"5436148c-4927-40f6-891f-611ab62ed35c","resolution":{"observed_at":"2026-08-06T15:26:24.220754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.201454Z","title":"The main instruction, associated data, low-priority query, and witness are shown","venue":null,"work_id":"8bfdefd0-54be-4272-a5b7-e388af3fb0d8","year":2024},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.856307Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:8fcd39288eccec862dca67216a369349f9bfd444e44f49346417f9e59749b60f","observation_id":"819db80c-6f7a-41c8-95cc-43838aab726f","resolution":{"observed_at":"2026-08-06T15:26:24.205877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.183366Z","title":"The system instruction and malicious user prompt are shown","venue":null,"work_id":"5170aedf-e58a-4b3e-a727-cbf284996e7b","year":2024},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:22.907922Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:3d4289fa54b7af088776a8e8fa4fea8b1245b1762bab4743e05d4f22f110a056","observation_id":"af8b48a9-fb0f-4028-879f-2730257b0277","resolution":{"observed_at":"2026-08-06T15:26:24.190719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-10T12:08:35.527130Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T15:26:19.894110Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.894110Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:d1b9c2bc1c4cc54066e7f59afc59970ba07361fe2eb5ea774e5aa2a345d8a7ce","observation_id":"9d527b4d-6f21-4db1-ba27-14c2408157a1","resolution":{"observed_at":"2026-08-06T15:26:19.894110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:20.262437Z","title":"ISBN 9798400702600","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.262437Z"},"links":{"citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:1a7bc7726f9622f7e83859cf17c4cadaacfcbe1c82cece8a214ca968be44f1d7","observation_id":"30e9e55d-4c40-43f6-9cfd-cc8d56e62fdf","resolution":{"observed_at":"2026-08-06T15:26:20.262437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T15:26:19.981630Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.981630Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:e77114da99ef45e4cd6a97130790a6fe921f4c1cc9180432233ee369ed9e0dc7","observation_id":"0b2d3b75-6674-4780-b91a-a1ebd25c0e05","resolution":{"observed_at":"2026-08-06T15:26:19.981630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-06T15:26:19.738283Z","title":"Pranjal Aggarwal and Sean Welleck","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.738283Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:415f9c34164cf09c95b8c73fdcd60e8a017ad0db9d863fa6d6bb54b885b59331","observation_id":"8868e2aa-1fe6-41e6-8068-78143ef4ebae","resolution":{"observed_at":"2026-08-06T15:26:19.738283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.15974."}