{"as_of":"2026-08-10T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ed2d2fa40563506ab3c627c35125a4b8eb0fc2e79f93f5b65bb74dd5fc9988d","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T19:17:45.652076Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09665/citation-record","integrity":"/paper/2607.09665/integrity","json":"/paper/2607.09665/citation-record.json","paper":"/paper/2607.09665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:d8b0e85660c2c778506929cbcf28868e6ccc4b5f6c91c98659db195e0494513e","observation_id":"6b6ec581-f290-4404-be87-3dcbbb16c0f4","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:2267e2b73a9d2e731761d11f6e968c7b7a56022c449533b0a213c737893b0646","observation_id":"09cdab15-dd9d-4d63-9ad8-0ecce553c316","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-05T13:54:21.157165Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://ojs.aaai.org/index.php/ AAAI/article/view/6239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:4c64f5351adabbc3187342b06fe617836723be8d5b5f67cf2992625beb66e4c7","observation_id":"e8914af2-baf3-49e7-a154-a2736ce6b76c","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-05T13:54:21.157165Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://arxiv.org/abs/2307.03109","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:03c97d1f4f753c8f4afcd5121d606db27e968ccb885dc22763c43180d46af29a","observation_id":"eccab05b-e102-485b-b051-3e2999f8d73b","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://aclanthology.org/2024.findings-emnlp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:14091f1c5ab57366f68bf252d6cf521f8fd15220d3d8dd985b21340d3280ccaa","observation_id":"2363525d-84d3-4a84-bcf1-45ee31c25ef1","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://aclanthology.org/N19-1300/","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:95f681fcd97f6c3060139748ce68de6b7caeb66446026c9707defb3c5b07ec3e","observation_id":"5511c3aa-8623-4393-933f-860ca7774ccb","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"Geng, S., Josifoski, M., Peyrard, M., and West, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:94bd3d7f264f135a00dee056fac6548d6e4c10b016cb7bc3e3b460856a250adb","observation_id":"5ecd3a10-21a6-4671-bfc0-f885cbe19181","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.769.https://aclanthology.org/2023.emnlp-main.769/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:20:42.132512Z","title":"Jiang, A","venue":null,"work_id":"6b36f3b3-a7ef-4dff-92bf-5eab611622da","year":2023},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:9f8b6163d2751fbc77f0bb0a59812c7a8b4e6a27c5618bff564adb3ad9318585","observation_id":"0815a6b4-79ec-4d72-b527-96920ae5db2d","resolution":{"observed_at":"2026-07-14T19:20:42.134136Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"11 Liang, P., Bommasani, R., Lee, T., Tsipras, D., Soylu, D., Yasunaga, M., Zhang, Y., Narayanan, D., Wu, Y., Kumar, A., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:1d112d7863f45b677bfab7666bd0adad057ab2556e22a0c2fefedce2cd65639f","observation_id":"03d2e122-9e28-487d-bf57-63bfb1f285fa","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:a2d39887b824610e3da782bcb9ba8e0a5db8c29aa4a7d97c15a284cd3932c275","observation_id":"d8853fd1-f623-4826-8649-25f1efe87079","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"Poesia, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:c85e64af70c65bfb22dbb57585f32a7c55c9a88d096f8239e5b511f78c7da93b","observation_id":"4619efed-830e-4c14-b120-99d86a27e0c6","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"com/stanfordnlp/synchromesh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:c872bc1606fefdfbb696370ee48b5783a12817bc171a831f734f94fbb4380989","observation_id":"a2157d05-b3e7-43bb-9e84-85cf0b15591a","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-04T15:07:29.209129Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://ojs.aaai.org/ index.php/AAAI/article/view/6399","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:4a1109130819078ca0166b010971cd1323e27f0f30ada8718d2d97458b2937c2","observation_id":"f939d13c-bfd1-46c4-a7d4-751fde27759e","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01632","last_updated":"2024-11-06T18:04:35Z","snapshot_observed_at":"2026-08-04T17:38:49.392434Z","submitted_at":"2024-03-03T22:38:35Z","title":"SynCode: LLM Generation with Grammar Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01632","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://aclanthology.org/ N19-1421/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2403.01632","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:672a5811bb5ef1ba5565facc4d96a4dbd2edaecdcc895ab3bcd4f4c19a38de22","observation_id":"5343ca1f-fdaf-4de4-b3c5-bd0be1cef803","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01632","last_updated":"2024-11-06T18:04:35Z","snapshot_observed_at":"2026-08-04T17:38:49.392434Z","submitted_at":"2024-03-03T22:38:35Z","title":"SynCode: LLM Generation with Grammar Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01632","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://arxiv.org/ abs/2403.01632","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2403.01632","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:7f10c8d4964c481024bc257788387e0b47beb4a6dfcc259374a3a2597515a9cf","observation_id":"e72bfb75-4daa-4463-b4a3-f2ec1bf5a4e6","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"Zhu, K., Wang, J., Zhou, J., Wang, Z., Chen, H., Wang, Y., Yang, L., Ye, W., Gong, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:dc005f08f2d19da5c3d36e9c0615d3fe0c9b62bf6c6447aeb073313eb5a7b56f","observation_id":"4448a36d-8194-49fc-9258-dbf5724d335e","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://arxiv.org/abs/2306.04528","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:fe64c90e25c6567291a6ba554e3424e6ed4ceeb6b3ce7c3a1de4514525bb542d","observation_id":"3e67b377-fb5f-4839-9e62-3a2f3fa3b155","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T00:20:04.568648Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2607.09665."}