{"as_of":"2026-08-19T00:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86dbe1b0998efb37d5b5b9123e6695c325d31b98617d86e69ee4b5d8bb85ad3e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:27:02.733283Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:53.163442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:14:01.385947Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-08-05T12:27:05.058009Z","title":"Simple o3: Towards interleaved vision-language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-16T02:02:56.335890Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:05.058009Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:fc9222bda35e4601d88e97effe398a46ac6f8ae634178b60bfc799c6de88c2af","observation_id":"6b3086fc-deea-4525-ae59-e3223509c596","resolution":{"observed_at":"2026-08-05T12:27:05.058009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-08-17T12:04:21.841904Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:4bddd4ac9a995ba3bae5b129e77a916bb3a78b13a469529992b0d772425ef56e","observation_id":"fdbfe2cd-031e-4256-a5dd-9b66120d58c2","resolution":{"observed_at":"2026-05-17T01:01:24.281441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2601.15724","last_updated":"2026-04-19T09:17:00Z","snapshot_observed_at":"2026-08-15T02:37:48.002238Z","submitted_at":"2026-01-22T07:47:29Z","title":"VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T12:17:42.135851Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2601.15724"},"observation_digest":"sha256:3d3911479c1600b5b62e5b0bdd3fc32669a6f7b47bd82314cc6bc5689d1f1fb9","observation_id":"561b72f6-fcf1-4d0d-abb8-6d26208d7b2a","resolution":{"observed_at":"2026-05-16T12:17:51.893747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-08-16T04:47:59.695653Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:eb5ba0f651852988f8201e81cfb2c1a9b1723cbca7ffe72e6625c601ece37427","observation_id":"e509e930-8ac9-4a69-b360-2b6548fc6a30","resolution":{"observed_at":"2026-05-11T06:51:22.873379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2604.19945","last_updated":"2026-04-21T19:48:19Z","snapshot_observed_at":"2026-08-13T15:38:33.593571Z","submitted_at":"2026-04-21T19:48:19Z","title":"Visual Reasoning through Tool-supervised Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:21.688216Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2604.19945"},"observation_digest":"sha256:a16a796f4238e0544671de16921d4ed7c21ce044639daa31bdc8083716305561","observation_id":"2dbacb33-27ce-49d5-8da9-63d5d80cbd75","resolution":{"observed_at":"2026-05-11T12:46:03.037923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2605.27959","last_updated":"2026-05-28T03:13:45Z","snapshot_observed_at":"2026-08-14T12:43:34.377960Z","submitted_at":"2026-05-27T04:52:42Z","title":"ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:44.049230Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2605.27959"},"observation_digest":"sha256:3e293a926e474e7e69e7892b371fe4f834ce02f8b3adc0eec76835d317ca443d","observation_id":"2dd8ea8b-77e6-401d-adb5-8bfb29d13606","resolution":{"observed_at":"2026-06-29T13:43:28.692325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2508.12109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-06-29T23:14:01.385947Z","title":"Simple o3: To- wards interleaved vision-language reasoning","venue":null,"work_id":"6dcbe0bb-eeed-4144-aabe-13a5eb7485df","year":2025},"citing_paper":{"arxiv_id":"2606.00096","last_updated":"2026-06-02T05:03:53Z","snapshot_observed_at":"2026-08-03T08:51:35.059162Z","submitted_at":"2026-05-25T13:06:59Z","title":"Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-29T23:11:14.114211Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2606.00096"},"observation_digest":"sha256:77dbc5c036b664c5c189ce61b769c7dcee42671d93f70345487d0dd2a6402e1d","observation_id":"c95c9da4-bb10-49d7-8a69-8c0f87e23101","resolution":{"observed_at":"2026-06-29T23:14:01.387511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2508.12109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2df61ef2923c1b6d2dfc7173729eac2594960c046139e69212124e37e10c4c6f","observation_id":"344e8fd7-555c-476c-85ab-15583a663e2f","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-08-11T12:53:14.330057Z","title":"Simple o3: Towards interleaved vision-language reasoning.arXiv preprint arXiv:2508.12109, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-15T15:07:39.655380Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.330057Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:34d54197205d0dfab41e4bee18d91760138780a7fbe212b3abef12caf1c1f296","observation_id":"11876701-c04c-48cb-9602-4d5af4eb6f62","resolution":{"observed_at":"2026-08-11T12:53:14.330057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-08-12T20:43:53.163442Z","title":"arXiv:2508.12109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T23:10:59.215042Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:53.163442Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:544f5e880e08266228466ee6676dc678ef02b213b6b56992856a3e068a8b825c","observation_id":"d456c607-d585-400d-a81c-843381b40b29","resolution":{"observed_at":"2026-08-12T20:43:53.163442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12109/citation-record","integrity":"/paper/2508.12109/integrity","json":"/paper/2508.12109/citation-record.json","paper":"/paper/2508.12109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.098888Z","title":"Observe next thatk!≥2·3 k−2 for allk≥2","venue":null,"work_id":"d8968f9b-51f1-4660-93fb-6d18fe78e9c4","year":null},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.671047Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:d1f881c6a83e1d80854fee6817be298c9b5d714aab96386c7d48eb879b4d7eee","observation_id":"8cce34c7-05f8-4984-b130-ff3ac1c8d66c","resolution":{"observed_at":"2026-08-15T17:27:03.102839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.086111Z","title":"Leskel¨ a and H","venue":null,"work_id":"adef04d2-51fb-44ef-9b03-dec50a2afc4e","year":2017},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.676060Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:ec55fbe4ebdf6cc0cebf8d29cad17f1eeb994e319bd3d542f80277cc578557b6","observation_id":"78700f18-e272-4065-9fd8-5f56dc2eaa4d","resolution":{"observed_at":"2026-08-15T17:27:03.089944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.073210Z","title":"Leskel¨ a and M","venue":null,"work_id":"0feaa7d9-d1ef-4ce1-b1bf-ebef876b8b1f","year":2026},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.680261Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:a4e18a865d0a1b18290a924474ce3edd6da55fd265933a20fd88485d1e39b371","observation_id":"1d9b00f2-bbc3-45db-85c0-e18368848632","resolution":{"observed_at":"2026-08-15T17:27:03.077237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.059963Z","title":"Lishamol and G","venue":null,"work_id":"bbeba5cd-bd7f-4e01-b145-8d260817ffc5","year":2022},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.684279Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:39a7bc463741752f42452c751441036aa38bcaec78a5901e5ea9f302b0958caa","observation_id":"7010c1a5-cba2-423f-b16e-b83411d033a2","resolution":{"observed_at":"2026-08-15T17:27:03.063788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.046807Z","title":"Matias, T","venue":null,"work_id":"180fefff-7e23-47a8-be17-6d161814d9ca","year":2018},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.688213Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:45a23cd085738d56631d05598e941c4bfa6c4db102e7e47c57ae075c9aa365ac","observation_id":"9a178448-e07a-43bf-9dcf-ded68f7911bd","resolution":{"observed_at":"2026-08-15T17:27:03.050876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.033748Z","title":"M¨ uller and D","venue":null,"work_id":"0a0b23ed-e3fa-4969-9e9d-d06a5578f601","year":2002},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.691982Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:c891477197eab8ebd522edcc2ae397a8b2f24f73368aa74390dd65394f3ab856","observation_id":"69cc453f-8438-46ed-bf81-e831fae1308e","resolution":{"observed_at":"2026-08-15T17:27:03.037744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.020674Z","title":null,"venue":null,"work_id":"15f140cf-77d1-4307-93fa-aad6f6da4871","year":2022},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.696144Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:193c3e4bf9fbc9963f71d983de9bc1f2ff1f52badc0aaf8f556c0b4cc4537f18","observation_id":"2de0c8b8-4ab2-46b3-9243-69169e875343","resolution":{"observed_at":"2026-08-15T17:27:03.024493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:03.008052Z","title":null,"venue":null,"work_id":"ea1035d8-f13f-4487-a528-89e18759c4b4","year":2014},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.700334Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:bc19c1d772c696938653eb1dee17d8be29bdc462658fd3094ed50706f41a9b69","observation_id":"90007ca8-6b3a-46e8-add9-a82337e6f18d","resolution":{"observed_at":"2026-08-15T17:27:03.011859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.994472Z","title":"Rave and G","venue":null,"work_id":"ba82fbb7-51a1-4866-a7d3-d746d9a9244e","year":2024},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.704083Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:d1969e31e024dd8159565f4d04549583da72894419bedbaee23ef4533ff82c8c","observation_id":"5a354da3-9e43-4295-9205-a8b4ab441456","resolution":{"observed_at":"2026-08-15T17:27:02.998401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.980998Z","title":"Sawarni, S","venue":null,"work_id":"9d89daa4-5473-45ea-80fd-dc4f9b307cc6","year":2023},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.707649Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:10f0c34d6a4e4634895645b814837a4bc752cc0a9a425d75421c691d4d174410","observation_id":"19004064-79a8-460f-a038-930e0d04ac8a","resolution":{"observed_at":"2026-08-15T17:27:02.985099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.966764Z","title":"Shaked and J","venue":null,"work_id":"065ccced-d2b2-4c78-9836-241eebcf9f58","year":2007},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.711219Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:aa30b62c9ae03d976ae640674673d467516759282f9a78127dfe046ad5d310f0","observation_id":"d2e75dec-d515-4bb0-8916-0e10d8a53c20","resolution":{"observed_at":"2026-08-15T17:27:02.971174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.950533Z","title":null,"venue":null,"work_id":"11c5d47d-0573-4198-85d1-4098f6d43514","year":1946},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.715201Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:218b19584c389f888e6d851d19ccee24e9d437fc0bcd8e5dc04a5b351f8ee4f0","observation_id":"e126dfaa-7739-4e2c-a6ab-0bf8289197da","resolution":{"observed_at":"2026-08-15T17:27:02.956114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.718971Z","title":"V¨ alimaa and L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.718971Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:f3464a29e78e8474bca385a6c419089f981490079a887a7cbb80ea6f17232ad7","observation_id":"f44797e0-5463-4980-9870-f45d96ad9a05","resolution":{"observed_at":"2026-08-15T17:27:02.718971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.936549Z","title":"Vershynin.High-Dimensional Probability","venue":null,"work_id":"9afe8960-5138-4607-bbc7-61770cacb5a8","year":2018},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.722678Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:25b4d179a5a26ad96c0f9d4d2cd043feef5a041e72a4c615aaaf89b728fd1faa","observation_id":"b77693e2-54b1-49da-85bc-84b0cb202e87","resolution":{"observed_at":"2026-08-15T17:27:02.941249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.923607Z","title":null,"venue":null,"work_id":"039fbde3-f4b9-4a2a-9774-35510e8d6391","year":2019},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.726179Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:4e4889f7f1dc0dd4c8521eacbf846bd4a1a88f117e7ac024bb760ca0ac7bdbdb","observation_id":"338bf648-8582-46f1-8bb6-3b73b639aad1","resolution":{"observed_at":"2026-08-15T17:27:02.927442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.909834Z","title":null,"venue":null,"work_id":"ff368d16-8678-4bd9-8515-df8019bae908","year":2017},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.729761Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:64f4e3dc06654f3f0cce26965c8003f29acef763dff53059849cfbb2bb7f6c17","observation_id":"d8c66104-b787-4f9d-a888-1bfde5be20ae","resolution":{"observed_at":"2026-08-15T17:27:02.913866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:27:02.895181Z","title":null,"venue":null,"work_id":"9e87bd12-2df7-41e1-8bee-35d50295a30c","year":2018},"citing_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:27:02.733283Z"},"links":{"citing_paper":"/paper/2508.12109"},"observation_digest":"sha256:08ee144768ba8bca7b17de6f29b1ad5bd30bbfc7bb3ab2ce597f7d1004d127cd","observation_id":"102395d0-d38f-409f-91ec-faffa357b577","resolution":{"observed_at":"2026-08-15T17:27:02.900313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:22:41.232393Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 10 inbound Pith citation observations for arXiv:2508.12109."}