{"as_of":"2026-08-10T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51f8fd8c755d64db0ba2ed612506ee1eee8b3dd406ed836752696617e89a8330","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:42.409411Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T16:55:20.099628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.322058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":297,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:32024c8b954ab855e98fc9167d1114182a00acf823f07688b1637dd72fcf1852","observation_id":"4cb3a065-2600-492c-a285-090f70fc77d3","resolution":{"observed_at":"2026-05-13T01:36:24.521889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:e4a9cf3a8df9ef2eec86b758125b429602597256af315314dc5a33c7f50271d1","observation_id":"cad82a6b-df4e-4c32-8a85-f002afae1123","resolution":{"observed_at":"2026-05-12T09:43:00.404330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:3f501b9f3b12216fb8c0af4a0ecad9bb6c6ed0ea2951cfa54546f4495eebebfb","observation_id":"23c52071-9374-4517-9e4b-b5b62d315cf2","resolution":{"observed_at":"2026-05-18T19:21:48.322627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-08-09T22:36:48.890275Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:8ec706ee5135ee8b296ba2c109087aafcf03b4c0b212095ae0f1fc5f6198b310","observation_id":"c0c118ee-ba2c-4943-91d0-197b451d7758","resolution":{"observed_at":"2026-05-17T22:25:22.690136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:c55d92f4b1ef9626b679150b7b21f8eb45b98ac9234fa59ccc14da50d7a91777","observation_id":"c5ef8303-4565-4db1-a785-e21994e09dc6","resolution":{"observed_at":"2026-05-17T02:11:26.499729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:0d17ef7e431e60fc8b20953434c34da6bbf65e13b8997eb0bac5d286a79d66fe","observation_id":"0b1a2ca8-b126-4ea0-a620-aba6a117bbea","resolution":{"observed_at":"2026-05-16T10:02:42.413324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-13T16:55:20.099628Z","title":"Star-r1: Spatial transformation reasoning by rein- forcing multimodal llms.arXiv preprint arXiv:2505.15804,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.27493","last_updated":"2026-06-06T05:46:49Z","snapshot_observed_at":"2026-08-05T12:08:07.856004Z","submitted_at":"2026-03-29T03:18:42Z","title":"Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T16:55:20.099628Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2603.27493"},"observation_digest":"sha256:c4b735849f32a80ae62ed43617f3b5ca4f13385f9b908e31985cd1e439f32a9a","observation_id":"f5fe546e-47f0-4f33-b2df-f9ef43d8d2e8","resolution":{"observed_at":"2026-07-13T16:55:20.099628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2603.27494","last_updated":"2026-04-13T08:50:29Z","snapshot_observed_at":"2026-07-30T04:57:09.309756Z","submitted_at":"2026-03-29T03:18:57Z","title":"Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:35:12.859669Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2603.27494"},"observation_digest":"sha256:a9afa5c2c0d1c040930d9688262763d13df6ec68648df9eedbe41677931089ed","observation_id":"e5b02838-3488-422e-b562-c080880d485d","resolution":{"observed_at":"2026-05-14T21:38:00.985595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2604.04372","last_updated":"2026-04-06T02:43:03Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T02:43:03Z","title":"Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T19:46:16.975267Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2604.04372"},"observation_digest":"sha256:8bb4ae433e0052be7cec5214165cf17838357ac2f8bab026d30a4e6a12f196af","observation_id":"9ae53715-7a4f-4529-9a94-fbda2d4735b4","resolution":{"observed_at":"2026-05-10T22:30:52.525638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2604.04379","last_updated":"2026-04-06T03:01:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T03:01:52Z","title":"Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T19:40:41.642852Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2604.04379"},"observation_digest":"sha256:baff1f4ca525b65e1b90f045e7317cdcdd0cace73b423f31037b3e4c6c7583cd","observation_id":"dd904fd6-2380-4591-afc2-19ec70eb6245","resolution":{"observed_at":"2026-05-10T22:35:52.573891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2604.05393","last_updated":"2026-04-07T03:43:01Z","snapshot_observed_at":"2026-07-06T22:54:08.897942Z","submitted_at":"2026-04-07T03:43:01Z","title":"Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T19:42:23.224746Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2604.05393"},"observation_digest":"sha256:a5dd4e694ec9033cbe3ab4847ff493ff70a48358ae7de3fbe5df23f3ece6987b","observation_id":"a1bcdc9a-4721-4290-a3e5-7842709a2325","resolution":{"observed_at":"2026-05-10T22:35:50.543718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2505.15804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15804","snapshot_observed_at":"2026-07-04T15:09:55.322058Z","title":"Star-r1: Spatial transformation reasoning by reinforcing multimodal llms","venue":null,"work_id":"be42cca9-ae40-4128-8688-a62b4195a19c","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.15804","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:deb208fb748bede17c5f9040a8cb294394be97d2344df01bec59095bee964c82","observation_id":"76164de6-9435-4e6a-a1ef-2695f34cf3de","resolution":{"observed_at":"2026-07-04T15:09:55.323884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15804/citation-record","integrity":"/paper/2505.15804/integrity","json":"/paper/2505.15804/citation-record.json","paper":"/paper/2505.15804"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T15:15:40.818259Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:40.818259Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:8e734bad8b6315bdb9c1feb39650c7ddb0d52e9d584922126b4a1be02152175e","observation_id":"dcdf50c0-212e-472b-95d0-367bc152ff3f","resolution":{"observed_at":"2026-08-07T15:15:40.818259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T15:15:40.872572Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:40.872572Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:682c4a4f4dc39747e66a93a69cb5adc2b06cd8e1f176607bf9366961e7f2eafa","observation_id":"841067a9-ed1a-46ba-a0ee-2455528740e4","resolution":{"observed_at":"2026-08-07T15:15:40.872572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T15:15:40.949358Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:40.949358Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:fecd4581c1fe8b3ec93fc1fa707cfd7d27ca03efbe960fd20b5d8f723e21a827","observation_id":"ca00110c-34f1-4ad6-9275-c01dd8fc5f2f","resolution":{"observed_at":"2026-08-07T15:15:40.949358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T15:15:41.008408Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.008408Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:1770f720886db68a6f4794b7c7b073fb5060bd2f349700b9af5860270b5c7fd5","observation_id":"ea2d13b7-7fab-409e-bd83-53ac10ced950","resolution":{"observed_at":"2026-08-07T15:15:41.008408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:15:41.082457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.082457Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:4e4103fe59a849ddace8fc7eeab4bcd7ad0f518ca150a458c843e608a22a9119","observation_id":"212cd02f-0c13-4f1d-adda-1d442496413e","resolution":{"observed_at":"2026-08-07T15:15:41.082457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.132137Z","title":"R1-v: Reinforcing super generaliza- tion ability in vision-language models with less than $3.https://github.com/Deep-Agent/ R1-V, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.132137Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:76af2a8a02f14b71bc561bc9efc5dfd5010bc1ef0c5d77d96eeb75546112a936","observation_id":"bd785b30-6e62-4a18-8f3d-bdbe30a01885","resolution":{"observed_at":"2026-08-07T15:15:41.132137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T15:15:41.240256Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.240256Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:468cadf3f29502a36a79f631d48648ca050ee136aba5c38672d9443cc1d8ab9e","observation_id":"c57b4766-fc0e-46f8-b0e5-4965091fba79","resolution":{"observed_at":"2026-08-07T15:15:41.240256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T15:15:41.254728Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.254728Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:c65fa892329569e606b758bd3423d2f9e3205c2610f12bb7c5877d8025e70df2","observation_id":"7fadc10a-2785-49c0-aedb-977e046774f4","resolution":{"observed_at":"2026-08-07T15:15:41.254728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:15:41.300013Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.300013Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:8de2d2844bd69d58a9e7bfc7b541910f27226e83bb54863205801ff9e5a17c73","observation_id":"b1d57b38-53f5-49c4-a16d-20c220232ee3","resolution":{"observed_at":"2026-08-07T15:15:41.300013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.309847Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.309847Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:23d2d6478a625677ef67a2c5c3adf0e602a92baaa286079592e6b3cb4167e17e","observation_id":"675891a1-c4a2-47a4-9012-e0581005d856","resolution":{"observed_at":"2026-08-07T15:15:41.309847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.364691Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.364691Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:20c7d6cbf8f3da21e2810d8ddef6b97bafa58904e1db50f29d752bd5227cfadf","observation_id":"a081f643-7ecc-473a-9653-2dedd8b9ab6a","resolution":{"observed_at":"2026-08-07T15:15:41.364691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:15:41.409185Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.409185Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:242eb8c0ec1ee6b8c946ee266e2f4badc727ac395bb2b8f70e1247ef116dc747","observation_id":"293ee2da-eb8e-4f1b-82cc-912464bb340f","resolution":{"observed_at":"2026-08-07T15:15:41.409185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.466292Z","title":"Sophiavl-r1: Reinforcing mllms reasoning with thinking reward","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.466292Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:d6b05f7b4cd5e922493c391493919f5b71dbdddd93cd690a096ea6a40f233e47","observation_id":"a4f0255e-e449-42b3-8f9f-641679fe6bcd","resolution":{"observed_at":"2026-08-07T15:15:41.466292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T15:15:41.500371Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.500371Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:386d87b34c74a916642f89ded1215ffcfb3de90bc7748afb6af7c5fe4d29bbcf","observation_id":"1901736a-b61f-43ec-9751-af79e224f2da","resolution":{"observed_at":"2026-08-07T15:15:41.500371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T15:15:41.535470Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.535470Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:0bc1423cc62e95085e2b9eeacb2f59649ec2baf9dc590e7de914927ebe588ef9","observation_id":"50844e53-ff55-471e-b50c-1fd8da55cd7c","resolution":{"observed_at":"2026-08-07T15:15:41.535470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T15:15:41.573252Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.573252Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:86b30d8681b434d61c0a82d06e99bb56f5915ff1bf31050bf444849322b25c7c","observation_id":"5d73b1f5-bc43-45ea-8adc-38778701ecfd","resolution":{"observed_at":"2026-08-07T15:15:41.573252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.605318Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.605318Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e03f77a04cf58f7a2c9f3032f7e1aa6a98d7a5233d498948d7d52363b309e517","observation_id":"f68052e0-3672-428a-a044-8e74c7dce9f9","resolution":{"observed_at":"2026-08-07T15:15:41.605318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:15:41.644523Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.644523Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e60bf830f465fa6308fc25ea1c3482d7a72c3ee14d7bfa7ccf290b863fe1d56d","observation_id":"37009068-0b55-4422-bbfa-5d26f070f066","resolution":{"observed_at":"2026-08-07T15:15:41.644523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:15:41.685199Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.685199Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:7f4792e851deddd4d0b00d474de1180a5db8395c3c61ddbe36c723a684211843","observation_id":"9e9b71cb-00c7-43cd-b130-f5b43043dd0e","resolution":{"observed_at":"2026-08-07T15:15:41.685199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:15:41.719514Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.719514Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:1039a62b268835b5840cc13739c10609f2c406035d68341b4fa7f2d803d97d11","observation_id":"a7e2a54a-18fa-44ae-8c03-ba17156ca081","resolution":{"observed_at":"2026-08-07T15:15:41.719514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:15:41.755343Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.755343Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:09ca10a2b26f47dab28943c4f1d16d94525b873cb6f489fbdc87a74cf9d94889","observation_id":"60642aa0-19f7-4be2-9edb-31f111399fa1","resolution":{"observed_at":"2026-08-07T15:15:41.755343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.794764Z","title":"Transformation driven visual reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.794764Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:2760fe9b8477634b982f09a4cfc1019c031cc2b9161ef77eccd63860a1907416","observation_id":"31f0ea88-2bad-4749-9571-c93c37a31657","resolution":{"observed_at":"2026-08-07T15:15:41.794764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T15:15:41.837834Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.837834Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:9aa78e8d6b7e8f3acd75c9f353265f20c06bdbead7dab676a32dfc46792671bb","observation_id":"917f6bee-c864-4648-aedc-76a5bb7d8451","resolution":{"observed_at":"2026-08-07T15:15:41.837834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:15:41.877810Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.877810Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:a8c809cfb785c60681b7d39d848824a2af2154d84be7444f29c6a5915ed6a837","observation_id":"f85bfca2-c3c0-4ca3-addc-00913ef40ebb","resolution":{"observed_at":"2026-08-07T15:15:41.877810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.919164Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.919164Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:71f7c363e706639bc323ead51c3a1c436aebe6b50a509387cf202e4aa2b695b1","observation_id":"d30f8d17-a1a3-411d-9322-29d2704458c1","resolution":{"observed_at":"2026-08-07T15:15:41.919164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:41.956284Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.956284Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:b531fbe1f3aaac4144d8c049d66c10bd30303a40cc45c0ae02c07c4cdce2f6a9","observation_id":"20186f00-b6df-410e-90fb-6bb84a7c64b3","resolution":{"observed_at":"2026-08-07T15:15:41.956284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:15:42.027467Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.027467Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:44d59982c81aaeaa92a57c96d0ed2ddd186858ce1ecbacd83577081d89d7c693","observation_id":"0a109d7e-59ea-4cba-8521-f65ccbe551f3","resolution":{"observed_at":"2026-08-07T15:15:42.027467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:15:42.075306Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.075306Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:70638ce07141d4678e22145ecbe9faec34688a949ee1d7c9a290fe64978974f4","observation_id":"5e666ddb-be36-425a-86fd-cf359b6216de","resolution":{"observed_at":"2026-08-07T15:15:42.075306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.096080Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.096080Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:efbf934d7085eac6f7552b8bb3cdf1c678111f8cc6cbe57019dec94028ff02e6","observation_id":"d582b926-e633-4030-af2b-ea3b7dd4edb3","resolution":{"observed_at":"2026-08-07T15:15:42.096080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20196","last_updated":"2025-05-26T16:39:52Z","snapshot_observed_at":"2026-08-09T23:54:01.660332Z","submitted_at":"2025-05-26T16:39:52Z","title":"Temporal Sampling for Forgotten Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20196","snapshot_observed_at":"2026-08-07T15:15:42.129693Z","title":"Temporal sampling for forgotten reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.129693Z"},"links":{"cited_paper":"/paper/2505.20196","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:bab3e7f610bd5db019a861b1a476aeab357a1db686f6213369b9eb11fbfd819b","observation_id":"caddb07a-2955-4f0f-b28c-415281230c70","resolution":{"observed_at":"2026-08-07T15:15:42.129693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.134756Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.134756Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e3ba10f7fa659dae3b37bd724425eb05eae61e624804d5df5b282575aa29c97e","observation_id":"fa3718f8-5a0e-4349-bf35-85bc59e9dbb5","resolution":{"observed_at":"2026-08-07T15:15:42.134756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.139301Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.139301Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:630cdff11b806b2972ae691d65e5cf63b6cfdd5631829e190c1056d10f9a45dd","observation_id":"44d8611a-5f30-48b5-bde4-b16373eea687","resolution":{"observed_at":"2026-08-07T15:15:42.139301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.143883Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.143883Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:63e7127a2079497175ce1e96ba388c8c91209b82d7d61c205f97e06055d144d5","observation_id":"eec8507e-f0c7-4735-a8fe-825ecadb582b","resolution":{"observed_at":"2026-08-07T15:15:42.143883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-08-07T15:15:42.147646Z","title":"Ir3d-bench: Evaluating vision-language model scene understanding as agentic inverse rendering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.147646Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:7f9ac8edecc1c78604fe96f807d194e34ec70861e0ede3152fe9aa55727419c8","observation_id":"58f1947f-c76c-4444-8630-cb9fb76e6631","resolution":{"observed_at":"2026-08-07T15:15:42.147646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T15:15:42.152250Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.152250Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:2e73685cc1feed388796c47923f62ee4a5a83ff96a5e45420374f35038301c9c","observation_id":"fdf7e325-6210-4536-bd71-a9c819e8432e","resolution":{"observed_at":"2026-08-07T15:15:42.152250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.156102Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.156102Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:cef5bfef0d6aa1631cd48b073564602232ade1ee033d96a572a3558afd598b03","observation_id":"25d24bf1-19d6-4345-88ee-c4c100b35c1f","resolution":{"observed_at":"2026-08-07T15:15:42.156102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.160189Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.160189Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:7336dce9f470a2c07c807eb90c4b2fb935408690c9ae76e54ef170438fb39fd2","observation_id":"0c8831b1-3d61-4d0e-8dc8-4c15ce522f78","resolution":{"observed_at":"2026-08-07T15:15:42.160189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.164590Z","title":"ivispar– an interactive visual-spatial reasoning benchmark for vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.164590Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:9274732104e93d8c149c1fb3cba9c04d81ac24407b25c6223f6e773fb2621b40","observation_id":"cb33604e-ab4d-4479-992f-5a4abef9a15e","resolution":{"observed_at":"2026-08-07T15:15:42.164590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T15:15:42.168926Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.168926Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:de4343aefb8feb3e9fe8a04c844b388d58157eeef97b4c0441cff5328f2b9015","observation_id":"f5b910e8-6cbf-4963-97ab-65f3af45f796","resolution":{"observed_at":"2026-08-07T15:15:42.168926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T15:15:42.173319Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.173319Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e18e5639c278b1e0d422c43baf1fcff2ff2ca0ff0a0040c10b7957751321591e","observation_id":"e0443644-5b99-45d8-aca1-fcc9c1fdd016","resolution":{"observed_at":"2026-08-07T15:15:42.173319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.177791Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.177791Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f4cbf2806003b052f64fe524b6c118a8e5778da3723a5bd7fefb19c7a1e6f937","observation_id":"2bf1dcc4-e754-41a0-83dd-12fce5eed07f","resolution":{"observed_at":"2026-08-07T15:15:42.177791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:15:42.182014Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.182014Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:95b068ac6d3f2a1acab1797ca45785ff586681f13d6afd91ca856e2ef94e9b05","observation_id":"735331ce-7784-402a-accb-e2dadbf6ddb1","resolution":{"observed_at":"2026-08-07T15:15:42.182014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T15:15:42.185632Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.185632Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e45dd4002ed5b5043dfd361ae9962b5806233ab38676fabb77b8bb78eef420f0","observation_id":"c8e46b05-bd85-4e0f-b50b-6367451fa9d2","resolution":{"observed_at":"2026-08-07T15:15:42.185632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.189660Z","title":"Maniplvm-r1: Reinforcement learning for reasoning in embodied manipulation with large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.189660Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e3adab7b44056b6280c7256bc8d097caa7c551a005feeb8d042853440d4aa178","observation_id":"dd0adcd0-9995-410b-bd76-a4e7d4c46316","resolution":{"observed_at":"2026-08-07T15:15:42.189660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.193280Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.193280Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f6fdb702d7ab75dd50c95b0340b9d2cab7b8c35bc59f50ef458395d94e8949cd","observation_id":"e12c1220-c471-427b-a623-b9aab9688493","resolution":{"observed_at":"2026-08-07T15:15:42.193280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T15:15:42.196929Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.196929Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:3961ae1bdb6fa98a540c7703e2941ec2d7159c8d9e8f6dde7d4c36ae7f11d3dc","observation_id":"1cb7b0e2-9c83-43a7-9cce-1d876cd68385","resolution":{"observed_at":"2026-08-07T15:15:42.196929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19990","last_updated":"2025-06-20T05:50:00Z","snapshot_observed_at":"2026-08-07T16:37:24.241241Z","submitted_at":"2025-03-25T18:21:07Z","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19990","snapshot_observed_at":"2026-08-07T15:15:42.201162Z","title":"Lego-puzzles: How good are mllms at multi-step spatial reasoning? arXiv preprint arXiv:2503.19990, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.201162Z"},"links":{"cited_paper":"/paper/2503.19990","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:3636c5ae88cf40cf0d9fdf4e9cf74a912e9569412d56920471db129b2eafe48f","observation_id":"bcf325dd-e680-401c-9b78-362e0746a881","resolution":{"observed_at":"2026-08-07T15:15:42.201162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:15:42.205991Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.205991Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:70f47c016dad66ad9a7552bae1080ec2a23282bee6c632faa8b004f407fc3210","observation_id":"44a1aefd-278f-4292-b814-a934fda0d30e","resolution":{"observed_at":"2026-08-07T15:15:42.205991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.210026Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.210026Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:67ad37a4ca145197e6f58b059f275318135988ee85e4a795a754b47f6b337a0e","observation_id":"4d813ab3-513b-41b2-98d7-a677c7f9c0d0","resolution":{"observed_at":"2026-08-07T15:15:42.210026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:15:42.214143Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.214143Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ba30169f182b483581510b382d4b682d8400f1adaf75c34dd01535afd298d82b","observation_id":"8b76ae6b-8b34-42b9-8a24-c21f19a89c97","resolution":{"observed_at":"2026-08-07T15:15:42.214143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:15:42.218603Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.218603Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:6e4b6891568c6edb2dce0de55a19de090395f73344504b00c90fb4190c6056f9","observation_id":"95cbe8c0-37a0-440d-834d-f0fb00ad8cf2","resolution":{"observed_at":"2026-08-07T15:15:42.218603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.627537Z","title":"Solidgeo: Measuring multimodal spatial math reasoning in solid geometry, 2025","venue":null,"work_id":"64beebbf-da20-475c-86b7-38b61062ef0b","year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.222331Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:a568ad2f06cf43e103a6f23afdbd3b6e338c1dade943c1adeaab75aee30e806b","observation_id":"489e5f84-5ebd-474e-ba7e-77519bc44865","resolution":{"observed_at":"2026-08-07T15:15:43.631470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:15:42.226384Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.226384Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ba3b2d15675afa19ab36bca72a491970f0179975342a0200f731411a0ec6b140","observation_id":"dc84bc8d-8da3-4aa6-a097-e5ddbc760436","resolution":{"observed_at":"2026-08-07T15:15:42.226384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T15:15:42.230745Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.230745Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:417149e3014425c73f778cf9a70bda70f0e113c36bcd00c4d3a1bb2dc1cf12fd","observation_id":"444d3501-957b-412e-94e2-d863ecb8ec32","resolution":{"observed_at":"2026-08-07T15:15:42.230745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T15:15:42.234497Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.234497Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:6f1d542408c08cd6fbfb4754dbf1fec6225c80966019d015e188d99cc85e1323","observation_id":"232b0cc2-325e-4178-9a77-6c71c261ab59","resolution":{"observed_at":"2026-08-07T15:15:42.234497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.243110Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.243110Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:b382efff168f63908a2d862d8ff0e7aae6d138036f68e5edd08c85fd8c000553","observation_id":"b6686393-a273-418f-857c-304c2427e61a","resolution":{"observed_at":"2026-08-07T15:15:42.243110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16636","last_updated":"2023-06-29T02:19:50Z","snapshot_observed_at":"2026-08-09T19:17:03.002158Z","submitted_at":"2023-06-29T02:19:50Z","title":"CMATH: Can Your Language Model Pass Chinese Elementary School Math Test?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16636","snapshot_observed_at":"2026-08-07T15:15:42.248418Z","title":"Cmath: Can your language model pass chinese elementary school math test? arXiv preprint arXiv:2306.16636, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.248418Z"},"links":{"cited_paper":"/paper/2306.16636","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:afedf1de90b20f645ad7002a729baa84d9ef6ca22c059797349661b463c0e879","observation_id":"164c55ef-ee9c-4dad-b383-3b7f377d05c5","resolution":{"observed_at":"2026-08-07T15:15:42.248418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T15:15:42.253671Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.253671Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:eb19f8640e94053c5898f4209a73cb7ab93d6b66d2c6380cf4cfd3bd7dfe7f0e","observation_id":"0d081f85-7c69-48b1-8c65-71e19db85da3","resolution":{"observed_at":"2026-08-07T15:15:42.253671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T15:15:42.258330Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.258330Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:4ad38d81d0152fbb12e2de36a0f5d586955455a004aca75a458cea8449f091b3","observation_id":"e8c930ac-37a6-4783-9ef2-ee21b8180066","resolution":{"observed_at":"2026-08-07T15:15:42.258330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T15:15:42.262101Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.262101Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:4a8ff289c40e836d4a789ebb89e672f58f98eb3b6d2ff8ee8c2912dc667453a0","observation_id":"51606719-fb28-47d4-ad15-36ff7ef06158","resolution":{"observed_at":"2026-08-07T15:15:42.262101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:15:42.266320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.266320Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:7950369cfb2e709dc0c97d33d71d5e108f92a29f48893b1884d807bb7a70b91e","observation_id":"ddc43479-a4c1-4e89-9009-4e231dfb0a77","resolution":{"observed_at":"2026-08-07T15:15:42.266320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00662","last_updated":"2025-05-01T17:03:17Z","snapshot_observed_at":"2026-08-07T15:57:19.356999Z","submitted_at":"2025-05-01T17:03:17Z","title":"DeepCritic: Deliberate Critique with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00662","snapshot_observed_at":"2026-08-07T15:15:42.269555Z","title":"Deepcritic: Deliberate critique with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.269555Z"},"links":{"cited_paper":"/paper/2505.00662","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:2818dec79d12b3fb2c1a67dc881d1da9a41240428f4497d68abb1677ea828f02","observation_id":"a6d0a0dc-20a9-4b37-b7ad-11ab42174270","resolution":{"observed_at":"2026-08-07T15:15:42.269555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.273216Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.273216Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:cafac3b772c4c0176ec4ce74f67a0c93d4ab73eac660da00d9cbe66f1a9bdb00","observation_id":"35e4b4e5-238b-4731-a32d-1a80201f4aea","resolution":{"observed_at":"2026-08-07T15:15:42.273216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:15:42.281622Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.281622Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:8a4f0660a77883e05d1e675ef13d78cd70612c31c7fe5f7954126b5ea84088e7","observation_id":"901e1fc9-dabd-4011-8231-b168b2820735","resolution":{"observed_at":"2026-08-07T15:15:42.281622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T15:15:42.285220Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.285220Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:0956fd52a75736746cf0b9f7624730a868213d0f78bdcd624ac4a4e043db971b","observation_id":"e23c3376-8607-4cfd-b530-4cdb6610b899","resolution":{"observed_at":"2026-08-07T15:15:42.285220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T15:15:42.289839Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.289839Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f41f7be3a8299c367f5fd1889c7b8f124a7963e3e9feed92134a108154cec2ab","observation_id":"519b80c0-16a8-4165-b300-b17059383537","resolution":{"observed_at":"2026-08-07T15:15:42.289839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:42.293769Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.293769Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:3664b2b11d22e25be090b0e06225ac06f79fbed69b7aabcffa0e38119ff815f3","observation_id":"e1520b89-e6ad-4e5d-95f4-2128216ee265","resolution":{"observed_at":"2026-08-07T15:15:42.293769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-07T15:15:42.297149Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.297149Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:7910baeaf5692a74ffcab6aa7b06f5e81296dbf291e24fe08ed1d73be0580d61","observation_id":"ba8898d5-c2c4-4162-b806-bda2c55114b5","resolution":{"observed_at":"2026-08-07T15:15:42.297149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T15:15:42.301134Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.301134Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:b95423d8cfda18f79e7d1c893aca22a9fe1b30e90e5ebba63faf9d01d8f0c367","observation_id":"4d24babf-3c90-4ee8-8d36-656b4965946f","resolution":{"observed_at":"2026-08-07T15:15:42.301134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:15:42.305127Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.305127Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f27d3c00f0dac4c445362266f08be71812e25acb2d391f7f9185dc06a1f69a7a","observation_id":"f67027c9-4458-48db-9a08-8c0e0be4206f","resolution":{"observed_at":"2026-08-07T15:15:42.305127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.599788Z","title":"We employ Qwen2.5-VL-7B as our base model and utilize vLLM [26] as the training framework","venue":null,"work_id":"f6f1e339-8780-4809-ac69-f87db8ad1c5d","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.309967Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:952c204a1bf1ca0dda51189e6407cbdc7f8f4fe9ae07cc9deb3997108b599ab2","observation_id":"096c5082-9f0f-4141-9b5d-e7cca97dc84f","resolution":{"observed_at":"2026-08-07T15:15:43.605647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.588348Z","title":"cube\", \"sphere","venue":null,"work_id":"d78269a7-a1aa-48c2-8502-bd8f7330a5b6","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.314386Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:2a94ad51de138db23bbb5828b8ad6bd3e6f5659a8ee5e0efa6a6671f71825bb4","observation_id":"244a5890-5c75-4fe9-899d-5cf984edde73","resolution":{"observed_at":"2026-08-07T15:15:43.592351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.577809Z","title":"large\" (radius = 6),","venue":null,"work_id":"19fa0eb6-85c0-4ca2-be2b-592c0e42d61a","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.318647Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:72d6e6ec2b72019bd290bed9b1bb82a85ccf3bfeeee8a6d5f692a30657b998f7","observation_id":"db0c6a97-a730-43a0-a38f-f16d909cd050","resolution":{"observed_at":"2026-08-07T15:15:43.581594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.567368Z","title":"gray\", \"red","venue":null,"work_id":"2d959ac9-69d2-4983-b763-046bbe0b7878","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.322551Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:013a98de6f3b382ec494663ea8c023932ddb33d9bea8eef8052e0aa3c277ad71","observation_id":"18b1c8d7-ee0a-4965-9833-d33fe965697d","resolution":{"observed_at":"2026-08-07T15:15:43.571255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.556560Z","title":"rubber\",","venue":null,"work_id":"a688f690-43ca-4ddb-a675-1aaa78bd967b","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.326696Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ce116be91f29df5570910494fb0502ccf2b525b11d94d7a975c6bc6baad8ab3f","observation_id":"c323fc22-ff28-4c8c-91f5-c36482bf9bc0","resolution":{"observed_at":"2026-08-07T15:15:43.560229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.545199Z","title":null,"venue":null,"work_id":"d3d0d899-04e3-4dd5-86a0-c00ecca16d7a","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.331251Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:df99ffef143a105bccf453ce4aa42cdfd322523775b96a4119e37eb80fce4986","observation_id":"873d6753-d86f-4d12-84b2-2cbb8531affb","resolution":{"observed_at":"2026-08-07T15:15:43.548789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.532267Z","title":null,"venue":null,"work_id":"500c22b9-2cd3-4e04-8866-08a5e5f845a6","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.335528Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f594ae690c5fb52163a2296beb2b3992f2f4b94e73e6507fc40a62bdb338bbfa","observation_id":"11a8e450-aaaf-4057-9dbc-be23bb60b513","resolution":{"observed_at":"2026-08-07T15:15:43.537164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.520866Z","title":null,"venue":null,"work_id":"3ad16b7e-6096-4dab-a223-7f109c3b9375","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.339882Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ad27734635ce17cb3b1588f2942e41624a22d9f5a9e2005e8ac426e6a9131d78","observation_id":"0f7bfbb6-b6d6-44cc-870d-d6db07df822b","resolution":{"observed_at":"2026-08-07T15:15:43.525219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.510185Z","title":null,"venue":null,"work_id":"07c23038-69c6-4ea0-b55a-ddb63aac1a2a","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.344086Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:1e9a33a1bb7bc8edf4a9cf0d643330eebba77628f1f1c9e40aaffc23775724a1","observation_id":"065dac49-2284-4996-aa2a-0163cf1d7964","resolution":{"observed_at":"2026-08-07T15:15:43.513574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.491056Z","title":null,"venue":null,"work_id":"1350411f-e134-4cae-afb4-8633e9017b88","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.347883Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:4c374ea6f7bd851519647edabc45f349908d760316bc27359573652c3507377e","observation_id":"4a827d13-3c5d-461a-9659-77a7cccc9283","resolution":{"observed_at":"2026-08-07T15:15:43.496484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.479415Z","title":null,"venue":null,"work_id":"7d8b9664-132e-45cc-b939-f72f6be0145f","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.351668Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:b4a2557cac085a03c89964e265307d52d4ec194afa73d30bba9fbbaa4fc7ede9","observation_id":"e93abd86-47ce-4df2-8ffb-6a464d6f5781","resolution":{"observed_at":"2026-08-07T15:15:43.483698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.467851Z","title":null,"venue":null,"work_id":"2533a411-beb6-46ca-a1bf-da7829b1b924","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.355256Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:edcf248abe34a4865bb06d805320f02b1783a01178eb473c490d548ca957719c","observation_id":"e66144b6-0ba6-492e-b06e-c3d0a3b6f0b9","resolution":{"observed_at":"2026-08-07T15:15:43.471860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.449068Z","title":null,"venue":null,"work_id":"4c96292a-51b2-4dc0-9c32-af43ffa626a5","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.359404Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e7aa689e96d2d7d7657bb917be31c7c4f59cb6ffecf4eb0b3774e8ad5686e59f","observation_id":"cfb56c9a-21dc-4c78-a0d7-f11722c27f22","resolution":{"observed_at":"2026-08-07T15:15:43.460565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.435855Z","title":null,"venue":null,"work_id":"6102c881-1b93-4c0a-a5bf-489cd1e61509","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.363581Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:97631861cd618ae2b9395929a285cbb2c0cc6d05993411af355975399d145d4d","observation_id":"ab463e98-fd8e-4f31-a007-2314901443fc","resolution":{"observed_at":"2026-08-07T15:15:43.440298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.421208Z","title":null,"venue":null,"work_id":"e1b11bcd-bf43-411d-a249-7f5b04e532d4","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.367119Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ad82e1e8b93a79ac0b9fd80ded3d1401bb50a38a506e3e84acbcfd9fdcf107a5","observation_id":"29dbecf5-bbf3-42fb-9721-69d2c6ec808e","resolution":{"observed_at":"2026-08-07T15:15:43.426319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.405341Z","title":null,"venue":null,"work_id":"642046f4-e4c2-466e-bfaf-f4601f03bfd4","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.370418Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:3359602cd2b281af0c66a3d35d1255794f5ddbc588291e1138567b7fe9d72a95","observation_id":"61be8813-fb52-4503-92fa-cd11e7f434f1","resolution":{"observed_at":"2026-08-07T15:15:43.411313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.391605Z","title":null,"venue":null,"work_id":"6de73adb-210f-4c57-a4a4-193bb69222a8","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.374440Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:0cafc86e7dfa831cf753aee6182c5cb03f7cd0040197c9e3e425ca6bde129f5f","observation_id":"183f12b8-9608-4408-9b86-3b50e85ac1a1","resolution":{"observed_at":"2026-08-07T15:15:43.397344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.379329Z","title":null,"venue":null,"work_id":"913a18a9-d1ea-4727-b57f-fdba05fa73ac","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.378262Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:ac5e837d43de704f22765497c7951996763f8e4f4ca4f5508af618a18f4c121b","observation_id":"d5820b93-e0f5-4ddf-a0a6-ed01e031abe1","resolution":{"observed_at":"2026-08-07T15:15:43.382882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.367875Z","title":null,"venue":null,"work_id":"9c81cb7b-26b1-4794-89ba-d9586853f97c","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.381824Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:5e6865f22249ec225b97c25773ccba83c97579c00783c7415645c6d252455356","observation_id":"a87e34da-cf3f-4178-8d74-735548c44d4d","resolution":{"observed_at":"2026-08-07T15:15:43.371422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.356034Z","title":null,"venue":null,"work_id":"bfd121f4-8772-4fc4-be19-f680fc18221d","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.386297Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e67c9be20238221cfead227bfc4795febf4154c0e05ba4a2c0e72cfc987a276f","observation_id":"9c93ac4e-86e4-4858-8a80-58a2ab6fa953","resolution":{"observed_at":"2026-08-07T15:15:43.359597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.343778Z","title":null,"venue":null,"work_id":"97aa7b05-c657-4146-98d3-b055f724685c","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.390123Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:c207e6079aa2fa7171684316684a9132dd384c05dc08e8cf61bfa82a250c6fdc","observation_id":"ca901aa9-f866-445d-be0f-d3bf6cc630ed","resolution":{"observed_at":"2026-08-07T15:15:43.347914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.330633Z","title":null,"venue":null,"work_id":"24e67acc-41c4-4403-9e96-affb0866f275","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.393717Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:48f041b230bd5b11e11886d0d50f84e10d4a19afc85a38e6ac2c61d7df5ff7bf","observation_id":"808d1f98-d957-4809-8e18-8245b27918ed","resolution":{"observed_at":"2026-08-07T15:15:43.334435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.315602Z","title":null,"venue":null,"work_id":"6f540464-b0dc-454d-a8bf-5262408f0788","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.397927Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:4c081549a07555a5dafddd9f8d05eb32dea611c3a36e3d5e7efbc553fb14d561","observation_id":"46eb0fbf-5a8a-4bda-aa91-b8eae4758204","resolution":{"observed_at":"2026-08-07T15:15:43.319013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.303150Z","title":null,"venue":null,"work_id":"c8364901-b716-4245-ab4d-7c9a199f6023","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.402199Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:e41597b0592664f5a2a2b89b187153a0ee2d7b0d8d2eec5517bcd47881261f08","observation_id":"20b72e1b-ea82-4c20-8442-c828b79e361e","resolution":{"observed_at":"2026-08-07T15:15:43.307761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.286223Z","title":null,"venue":null,"work_id":"f1e5fe52-d713-4d80-8dbe-e31a7a6d7481","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.405954Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:cfc30017e9436f0e2028807e202cee301639479f33e04daf967184bf922869da","observation_id":"9a894983-d8ce-402e-b519-68e6b63834c0","resolution":{"observed_at":"2026-08-07T15:15:43.294524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:43.211592Z","title":null,"venue":null,"work_id":"98be41cd-9734-4005-abb5-18c220cedfbf","year":null},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.409411Z"},"links":{"citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:29e9d4ff67746eef0d220857e123ccd17b2684e146b3881633efc5b5ac27062d","observation_id":"6335bd32-dda7-42fb-b6b2-ff2428698243","resolution":{"observed_at":"2026-08-07T15:15:43.245130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 12 inbound Pith citation observations for arXiv:2505.15804."}