{"as_of":"2026-08-18T00:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10c2ea7c28289ceb444ef5f952bcdacb92f1147480b86b1e9d8728979620f0ae","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:49.325182Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T13:38:03.546834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.964053Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"cited_work":{"arxiv_id":"2505.23727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23727","snapshot_observed_at":"2026-07-04T15:09:54.964053Z","title":"Pixelthink: Towards efficient chain-of-pixel reasoning","venue":null,"work_id":"667bd6fc-6a92-4c21-92c0-00265cc5edf5","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2505.23727","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:a44479be6fa0c96d17d3fec5adce46ee143a4a83c99320fc36de98bc91341b60","observation_id":"65e3b23c-75ec-4b0c-b5cb-825c7e0ef0d9","resolution":{"observed_at":"2026-05-11T10:11:06.680384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"cited_work":{"arxiv_id":"2505.23727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23727","snapshot_observed_at":"2026-07-04T15:09:54.964053Z","title":"Pixelthink: Towards efficient chain-of-pixel reasoning","venue":null,"work_id":"667bd6fc-6a92-4c21-92c0-00265cc5edf5","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-08-12T22:45:35.785489Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2505.23727","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:1af15a1146d1c2e5dc16f4583f12fd316bcfeb14d3a033aca9164e18c3068f3d","observation_id":"2aff3429-372d-4715-8e88-22264670b1a0","resolution":{"observed_at":"2026-05-11T04:30:59.842628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"cited_work":{"arxiv_id":"2505.23727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23727","snapshot_observed_at":"2026-07-04T15:09:54.964053Z","title":"Pixelthink: Towards efficient chain-of-pixel reasoning","venue":null,"work_id":"667bd6fc-6a92-4c21-92c0-00265cc5edf5","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-17T15:34:17.600386Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.23727","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:9d2a0418bd0f41f2697dafa3dfe52f3b13ac756eee83a8493b4f41ebc886a88e","observation_id":"eef658b0-ee47-4ffd-a49d-4c206216bc64","resolution":{"observed_at":"2026-07-04T15:09:54.966001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"cited_work":{"arxiv_id":"2505.23727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23727","snapshot_observed_at":"2026-07-04T15:09:54.964053Z","title":"Pixelthink: Towards efficient chain-of-pixel reasoning","venue":null,"work_id":"667bd6fc-6a92-4c21-92c0-00265cc5edf5","year":2025},"citing_paper":{"arxiv_id":"2607.02497","last_updated":"2026-07-02T17:56:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T17:56:49Z","title":"Seek to Segment: Active Perception for Panoramic Referring Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T14:39:22.617747Z"},"links":{"cited_paper":"/paper/2505.23727","citing_paper":"/paper/2607.02497"},"observation_digest":"sha256:168735d02c7d26179e8877c262b34301441036a0d84c350410c10d0ceda0e6e4","observation_id":"a391c2ba-5640-49db-8efe-ca035b958005","resolution":{"observed_at":"2026-07-03T14:48:32.636192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23727","snapshot_observed_at":"2026-07-11T13:38:03.546834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04779","last_updated":"2026-07-06T08:10:03Z","snapshot_observed_at":"2026-08-14T06:36:24.522942Z","submitted_at":"2026-07-06T08:10:03Z","title":"DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T13:38:03.546834Z"},"links":{"cited_paper":"/paper/2505.23727","citing_paper":"/paper/2607.04779"},"observation_digest":"sha256:0ca84e070a2b914a47691eebd3950c40fc1a4d6563d857f257dbed4db504264e","observation_id":"93f3c467-b83d-4ba6-b091-288392f93fe6","resolution":{"observed_at":"2026-07-11T13:38:03.546834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23727/citation-record","integrity":"/paper/2505.23727/integrity","json":"/paper/2505.23727/citation-record.json","paper":"/paper/2505.23727"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:40.528887Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:40.528887Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:14c7ac3d70b83f7579e572528877bc312a812a3690e4f2ffdb9b305b8f9fe029","observation_id":"e9c530e1-301e-452a-aa53-0f4f72eded95","resolution":{"observed_at":"2026-08-07T12:45:40.528887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:56.569635Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"9afbaca7-2403-460f-9300-789da66b8e1e","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:40.599512Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:6f5c1b1097695c831fafe9680aba84cecf8fd61887c2fb7dd90cb867848aebac","observation_id":"c85d2a63-db7d-4920-a030-357df615d65e","resolution":{"observed_at":"2026-08-07T12:45:56.662142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00640","last_updated":"2025-04-01T10:51:01Z","snapshot_observed_at":"2026-08-16T12:45:00.036095Z","submitted_at":"2025-04-01T10:51:01Z","title":"POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation","version":1},"cited_work":{"arxiv_id":"2504.00640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.00640","snapshot_observed_at":"2026-08-07T12:45:51.196703Z","title":"POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation","venue":"cs.CV","work_id":"967e24bf-bf38-4685-b63a-35580c6a8a6a","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:40.721525Z"},"links":{"cited_paper":"/paper/2504.00640","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:d70e864a9f9ea74afc470271144805814a4517c4fe530b4dfdbe618cab3c6666","observation_id":"3b7ac6dd-0d72-41c7-ad02-498abbe7684f","resolution":{"observed_at":"2026-08-07T12:45:51.290601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:56.307269Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs","venue":null,"work_id":"cbf93499-1f70-4e65-83d4-99d9e03063c4","year":2017},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:40.821394Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:77ca7e6b91fcec9c3b43c9e3fff870dec864019171ec59bc8fabd879889bbded","observation_id":"abded3a6-ab1e-4a87-badf-df1d9f0098f5","resolution":{"observed_at":"2026-08-07T12:45:56.424010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:56.078807Z","title":"Masked- attention mask transformer for universal image segmentation","venue":null,"work_id":"14482de0-69b6-498a-8664-4ac54a697cd4","year":2022},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:40.960493Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:2ba4f81f9e430bdd8994b0babcbad9da507248c0c27245460556218b34ce5ab1","observation_id":"aadcc3f0-481f-4d1a-b49f-36a5aec754c1","resolution":{"observed_at":"2026-08-07T12:45:56.179089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.846692Z","title":"Mask r-cnn","venue":null,"work_id":"d89b824c-d203-4e91-9f04-609d684428db","year":2017},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.066913Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:2347c1a8c90b9b2d5b2c19dc6695c018892517bd856993345b19dedfa3bf7d19","observation_id":"e5c4088e-6bba-49d7-86a4-ff1ea31018a1","resolution":{"observed_at":"2026-08-07T12:45:55.940441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.584047Z","title":"Lamm: Language-assisted multi-modal instruction-tuning dataset, framework, and benchmark.Advances in Neural Information Processing Systems, 36:26650–26685, 2023","venue":null,"work_id":"d94a1209-83b1-4e91-a8b0-33c3b646afcd","year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.202004Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:0ad6df6db5a67baa56c30fab29a582119574ee5bbd3beedd9a014e7f5dc993c1","observation_id":"f1fd865f-308e-44e0-8842-1b526f9c4c76","resolution":{"observed_at":"2026-08-07T12:45:55.682226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00513","last_updated":"2025-06-16T13:53:34Z","snapshot_observed_at":"2026-08-16T12:54:00.863321Z","submitted_at":"2025-03-01T14:38:42Z","title":"Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00513","snapshot_observed_at":"2026-08-07T12:45:41.330241Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning.arXiv preprint arXiv:2503.00513, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.330241Z"},"links":{"cited_paper":"/paper/2503.00513","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:6fa9a943f9646911fd3151222ab114a8cc97f149882eaeed786e7d5cb243a4aa","observation_id":"4f7a7ac9-3408-41b2-a512-b91ee6d9304d","resolution":{"observed_at":"2026-08-07T12:45:41.330241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-07T12:45:41.425108Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models.arXiv preprint arXiv:2402.12289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.425108Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:63fb6ab6bb2353375ef1c5612d7af7871ada1897facab57120b96d490872bd53","observation_id":"5bcc5003-2b08-4172-b713-edda78ccc6d8","resolution":{"observed_at":"2026-08-07T12:45:41.425108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-17T18:35:59.270100Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-08-07T12:45:41.564697Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data, and metric perspectives.arXiv preprint arXiv:2501.04003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.564697Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:b864cb6fd7c11f95a96c0b79cd2f79dae0d45c24a59b2dc8c96c21d171509966","observation_id":"39bd3ae6-0ea5-48c6-a8d7-f6e4be4c5309","resolution":{"observed_at":"2026-08-07T12:45:41.564697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:41.678292Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.678292Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:f823e4b04320e93aabb500b65faa6ecdd76842ca4852bd34faeb492193ef794f","observation_id":"29c39849-422d-4183-ab12-bc75d4212f85","resolution":{"observed_at":"2026-08-07T12:45:41.678292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.327583Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"26015f09-931c-472b-867e-83c2e677621e","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.807075Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:7d070c2e5859eefb468a7d9f70189077963227678de19bbedc5f22cdb3017eec","observation_id":"c14fc619-572c-43c3-9df3-d068ec168ecb","resolution":{"observed_at":"2026-08-07T12:45:55.433582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:45:41.894174Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:41.894174Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:b0437baba9a8c6783822f1305e915e6d6b552845e2514582f3b4475b7977a758","observation_id":"25340ec9-6150-4d27-bc9a-75ff2dc3bd1a","resolution":{"observed_at":"2026-08-07T12:45:41.894174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:45:42.033959Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.033959Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:933d1e97e1ab96efbd2db928bacecfeec7ffb7f1474b81665f758f4a125b38d4","observation_id":"172337ab-ef93-4e18-aa86-a59beb93d021","resolution":{"observed_at":"2026-08-07T12:45:42.033959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.054562Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"0525e521-f38e-4dbe-a634-1a3e4b01fa19","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.147050Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:c04a1fd333cbf8cb3c1bf62cab49e035ba3e3cd2ad1aa99ae9958bee53b9f24d","observation_id":"9e789f4d-afc6-42ea-8178-4bad8686c8a5","resolution":{"observed_at":"2026-08-07T12:45:55.209420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.781661Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"1976795f-71af-408d-9e67-ac6225764e32","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.202679Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:bc7153be86e280360d221e59596632dd8fab42e7abcb205562684a0fffe58030","observation_id":"5809c1e1-7142-4f80-bbad-4ed6e7bb8d8a","resolution":{"observed_at":"2026-08-07T12:45:54.893435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:42.328505Z","title":"One token to seg them all: Language instructed reasoning segmentation in videos.Advances in Neural Information Processing Systems, 37:6833–6859, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.328505Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:59889c9432cd5b9053f5b7882b75e221f82cb97a95170a36e80d5473bbe88997","observation_id":"93fe76aa-8ec5-43d7-bc3c-054e0241a974","resolution":{"observed_at":"2026-08-07T12:45:42.328505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-16T12:51:49.357503Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T12:45:42.478046Z","title":"Seg-zero: Reasoning- chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.478046Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:dd94d3c3cddb630f5940addc22a4068a793c47b3ec4f87fafa44fdb03e95b6ae","observation_id":"a7f9f543-9be1-45d9-9a85-494486069e7f","resolution":{"observed_at":"2026-08-07T12:45:42.478046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T12:45:42.624891Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.624891Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:35b587d5bbb7f6fa5b19dcb91ba4369f6299775a4876b89e24c2b2a704f9dbe4","observation_id":"ad735f36-99db-4e88-9149-6f6265565e40","resolution":{"observed_at":"2026-08-07T12:45:42.624891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T12:45:42.775228Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models.arXiv preprint arXiv:2503.09567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.775228Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:d2acc35c8fe6a75ccdf3591cab2d6747aa977ad292ec5b06e38d83b85c6d4f45","observation_id":"9babf3c8-dab2-4c2a-8a6f-d0b944961067","resolution":{"observed_at":"2026-08-07T12:45:42.775228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T12:45:42.916533Z","title":"From system 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:42.916533Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:a99211fd76bcf157ee6bb84c1e1f7a2c0392b4a17b77b6a5c4464c933c55c643","observation_id":"758ab3e0-ee7c-4a81-a153-d223a9a14567","resolution":{"observed_at":"2026-08-07T12:45:42.916533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:45:43.033198Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.033198Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:efce62ca9466ba13a844f8698b4c9579de0d75cb17cc34a27535955f551625d7","observation_id":"509240d8-4f57-4570-83e5-c62b8bc25153","resolution":{"observed_at":"2026-08-07T12:45:43.033198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:45:43.144525Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.144525Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:488ca02735f1f427e2ae26b4a38cdebb6be2050dc61690a24b5aea418e8e446b","observation_id":"5b48a37c-a04e-4115-b913-a8236ed149d1","resolution":{"observed_at":"2026-08-07T12:45:43.144525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.541532Z","title":"R1-V.https://github.com/Deep-Agent/R1-V?tab=readme-ov-file, 2025","venue":null,"work_id":"365b9055-1e4e-4997-a30f-5fba8c3468eb","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.256104Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:9e5b34566a3c46a56e8f9ad90874b49eecbe5fc105ff20a4baa75205532e45d6","observation_id":"ea4145ac-7bb6-4db7-a498-3cd8d0a6ce32","resolution":{"observed_at":"2026-08-07T12:45:54.647463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T12:45:43.373987Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.373987Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:69311c1c619d1f62c97ed9ab341dfc16b0fbc4d043a27080c2943c407b287612","observation_id":"9498b81c-33b4-406e-8272-b15b92f26e6f","resolution":{"observed_at":"2026-08-07T12:45:43.373987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:43.494739Z","title":"Efficient reasoning models: A survey.arXiv preprint arXiv:2504.10903, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.494739Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:331e51d958ac992ca2389ab8ef77bee2ea6f7510b1900f2fef0d6efa3b2947fc","observation_id":"a51758b7-d85c-4ca0-9bb7-f7403779b27d","resolution":{"observed_at":"2026-08-07T12:45:43.494739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T12:45:43.636519Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.636519Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:aa5e46ed09fc84868a3af31f5b1e1a29b8b0d5efc7fa6961bf5a5dbbd0d3a34a","observation_id":"4b7ce38a-bfce-4751-a9ed-51581b000b01","resolution":{"observed_at":"2026-08-07T12:45:43.636519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:43.763499Z","title":"Sam4mllm: Enhance multi-modal large language model for referring expression segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.763499Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:02751c61e27b188d0cbec9571108a7e254bcc0fa147708638bb3c9521db0e7d9","observation_id":"f5d7b6ea-9da5-4967-b817-2dc30cd3c00a","resolution":{"observed_at":"2026-08-07T12:45:43.763499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T12:45:43.891818Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:43.891818Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:85c886e73e54e5d3e4607935532964edff4f7bd67293c5918952c706d9c06049","observation_id":"f10a5cc4-8fc3-457d-bfd3-bd3ff5b4bb19","resolution":{"observed_at":"2026-08-07T12:45:43.891818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.274110Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"17b9372b-249a-4c7f-8bbd-71e2dbd60a47","year":2014},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.013359Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:d68ce35ced69d8a3fab206ffb2a77e8e678198495fd6523a96ebb9d3dc3de549","observation_id":"aeb88d7b-eadd-4863-a39f-ccce7300b521","resolution":{"observed_at":"2026-08-07T12:45:54.420700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.087665Z","title":"Towards robust referring image segmentation.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":"dd475149-28c8-4118-895e-af18622b719b","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.109823Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:242d46521f2b6ea2991659ea46aa52b6f302c3a70122f61adee180f4b3709ec3","observation_id":"def141f6-31f6-4bd8-9d3f-90333b08f475","resolution":{"observed_at":"2026-08-07T12:45:54.170448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.892044Z","title":"Remamber: Referring image segmentation with mamba twister","venue":null,"work_id":"956dff0d-88c4-4b35-a8fa-2cfd968caafa","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.249632Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:cee9fbd3675d69ad0b56db1dddca7425b194877aa3ae6107f1bc1ee8a10b9fee","observation_id":"dcab0df8-cc3b-46ea-8408-b9dc3b5e632a","resolution":{"observed_at":"2026-08-07T12:45:53.980694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:44.369152Z","title":"Mask grounding for referring image segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.369152Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:dc75f100e2254663bc73458b80c965436645017248d91d4a35ee29a58c498f57","observation_id":"7c9a332f-a64a-45dc-82a1-15e3cf5f4a24","resolution":{"observed_at":"2026-08-07T12:45:44.369152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.664890Z","title":"A mutual supervision framework for referring expression segmentation and generation.International Journal of Computer Vision, pages 1–16, 2025","venue":null,"work_id":"94c31663-5cae-4eec-afd1-c48ae1c20aa9","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.489010Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:b12d5f7034190261a6418c9315e5408a86646a2a60e47e453209f0ef1300afc7","observation_id":"120cba28-27d0-4f29-8a95-a4fba548ade5","resolution":{"observed_at":"2026-08-07T12:45:53.751979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.457434Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding.arXiv, 2025","venue":null,"work_id":"41ef6143-270c-4572-ac98-8649990ef689","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.593422Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:35cc8760dcf1d60c9bb666a00e3d62eff5bdb22ded5fbde3ffaf4375144d75f3","observation_id":"a12b4204-9fa7-4b6d-888b-6f2e11a24395","resolution":{"observed_at":"2026-08-07T12:45:53.553534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.197211Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"1e9ce566-0401-48f4-92ec-f3bdb05e3936","year":2015},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.733818Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:b21e30dcc0b89555a4817b60dc915028d82a6ae5142d87fc5f99d71aea41c88b","observation_id":"4f3ef293-2857-499a-8ead-9cf4ea864dc7","resolution":{"observed_at":"2026-08-07T12:45:53.343753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.919379Z","title":"Segment anything","venue":null,"work_id":"b56dd838-a7a4-4c05-ae0e-b7801e3cf7f9","year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.872837Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:c4cc34a7b13a7f8e4ded91b8592e4d868a6d2ddec7b4c7becf57811977ed0c46","observation_id":"db27352c-e588-46ed-b42e-3b1aab24532b","resolution":{"observed_at":"2026-08-07T12:45:53.055280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-16T14:31:04.236202Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-07T12:45:44.966934Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:44.966934Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:2b31774e19abe02e0f875f0757a399a64de2bfc3f573941206dcdbe6dfbf19c8","observation_id":"223c34e4-a933-4b81-a9e9-357fc0e6451b","resolution":{"observed_at":"2026-08-07T12:45:44.966934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.698115Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv, 2025","venue":null,"work_id":"ba1de5a7-0a34-4268-8e44-88c7b4de573b","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.065669Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:436b62a55955d2633fb00265834daccb177f7c1e21f8efb5fb19b8f50c9775a5","observation_id":"0a77e824-65fd-4963-b8e0-73070732e6bf","resolution":{"observed_at":"2026-08-07T12:45:52.800808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:45.183443Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in Neural Information Processing Systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.183443Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:9e3533bcf1add679c2ff46e4370525f1e1f2c37adf8088c4117c0819c41601e0","observation_id":"ce371911-473f-4dc6-9c50-f66fe4f1888f","resolution":{"observed_at":"2026-08-07T12:45:45.183443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T12:45:45.327386Z","title":"Automatic chain of thought prompting in large language models.arXiv preprint arXiv:2210.03493, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.327386Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:16dbfab4830127d69c11f7b5b31b5bdd64fc48d1cf517e9eda40baf81bdf90ec","observation_id":"c06fddbc-7fd3-4fb6-bc7f-1c763812e03a","resolution":{"observed_at":"2026-08-07T12:45:45.327386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04959","last_updated":"2023-10-08T01:16:55Z","snapshot_observed_at":"2026-08-16T14:54:10.586967Z","submitted_at":"2023-10-08T01:16:55Z","title":"Towards Better Chain-of-Thought Prompting Strategies: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04959","snapshot_observed_at":"2026-08-07T12:45:45.422348Z","title":"Towards better chain-of-thought prompting strategies: A survey.arXiv preprint arXiv:2310.04959, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.422348Z"},"links":{"cited_paper":"/paper/2310.04959","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:e4b80074715000bd136d74406f28a73538a9a0711110d2be595d5a5431ba54b9","observation_id":"953f057e-1778-438b-9544-48944fbe92ca","resolution":{"observed_at":"2026-08-07T12:45:45.422348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T12:45:45.543162Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.543162Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:8f397625698dd6ed9ebf3baf8df698d75fab430c79674a29056f3581a293c786","observation_id":"18fc7829-96fa-47f1-9703-a59bde8fb76f","resolution":{"observed_at":"2026-08-07T12:45:45.543162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-16T12:50:24.293917Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T12:45:45.679803Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.679803Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:99024e0036cd87343daca0fe8a18c5486b1017f89a6f42b1c613ac3a36e86823","observation_id":"98bcf2ab-b1af-405d-b0dd-0ffed01820e9","resolution":{"observed_at":"2026-08-07T12:45:45.679803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-17T23:05:04.457292Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-07T12:45:45.805388Z","title":"Prmbench: A fine-grained and challenging benchmark for process-level reward models.arXiv preprint arXiv:2501.03124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.805388Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:e24a6a321cbc4acc8add11fc7646f2f6e16f0e61f3c62eac0a3ea289b534838d","observation_id":"495b41d2-2427-436a-9c92-bc82e99c77d2","resolution":{"observed_at":"2026-08-07T12:45:45.805388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:45.891852Z","title":"OpenAI o1.https://openai.com/o1/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.891852Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:e98eb3ac11b1e50f7d88d6d3f5ca0ace2f95ac038540dda74bd8876a6919d43d","observation_id":"07be56fd-eeef-47ac-88c1-94ce2181fd92","resolution":{"observed_at":"2026-08-07T12:45:45.891852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T12:45:45.977413Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:45.977413Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:cfe98bda35e6855ca3d5d5f11f41c8c7b47b56d77e12c4d2aa531551fe346722","observation_id":"27c9ec78-1897-4946-8a51-8a205da80bc8","resolution":{"observed_at":"2026-08-07T12:45:45.977413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T12:45:46.077612Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.077612Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:c9151756970cea9f237a4293c2cc179ed0fac3df466507cde9b363ba8b95e81c","observation_id":"07d63e1e-308a-4252-b7d1-74c29b4ca781","resolution":{"observed_at":"2026-08-07T12:45:46.077612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-15T02:15:11.844567Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T12:45:46.144862Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.144862Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:7eee7ecd739c8986da24c7e48e3aa5ab316e162c44f43cad09e6383ff830be0c","observation_id":"e8b51122-ee9a-4f4c-a762-8a2f07fc51e9","resolution":{"observed_at":"2026-08-07T12:45:46.144862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-08-15T13:55:17.887932Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T12:45:46.198402Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.198402Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:e74fecca77d09e64d2c8e11bdc61d33e4bc465396f2b2d5c053dc43eaae422c1","observation_id":"28802efd-f994-49e1-ae31-14b1dbdd4de2","resolution":{"observed_at":"2026-08-07T12:45:46.198402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.493274Z","title":"Open R1 Multimodal","venue":null,"work_id":"eff9d2f7-7085-4c50-81d1-16336ec83456","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.260444Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:985336d2567fad58751e2930374beb3899b5c626a21ac238fadf3e10c27e49d1","observation_id":"504f63f2-81b5-433b-b5cc-aebbe956ac3b","resolution":{"observed_at":"2026-08-07T12:45:52.576238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:46.355639Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.355639Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:5a42da94a422e2a022db0fc9fdd729c404fbadce7da9c1ea6bd3c834cb9752a1","observation_id":"ba38a7ee-5ee6-472f-b365-1379f93f506a","resolution":{"observed_at":"2026-08-07T12:45:46.355639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23077","last_updated":"2025-08-13T15:48:46Z","snapshot_observed_at":"2026-08-16T12:45:45.167493Z","submitted_at":"2025-03-29T13:27:46Z","title":"Efficient Inference for Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23077","snapshot_observed_at":"2026-08-07T12:45:46.479922Z","title":"Efficient inference for large reasoning models: A survey.arXiv preprint arXiv:2503.23077, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.479922Z"},"links":{"cited_paper":"/paper/2503.23077","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:924b3fb3d7cf9b3c7f809b7f85fdd943beb3e8b977008b369b3223a244a0d07b","observation_id":"c03c36a2-7818-47bc-9124-33934af2f74a","resolution":{"observed_at":"2026-08-07T12:45:46.479922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:46.575425Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond.arXiv preprint arXiv:2503.21614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.575425Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:50d46d536949ae6c20f12afa4a10944bcda0b71339c87450661a12a75d7b72f7","observation_id":"1d42fa26-364f-44fe-b663-9eff29dccd5e","resolution":{"observed_at":"2026-08-07T12:45:46.575425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-16T12:59:58.216334Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-07T12:45:46.718839Z","title":"Token-budget- aware llm reasoning.arXiv preprint arXiv:2412.18547, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.718839Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:2a5c3030bbaf8014460ba70b7a1f57371b65871daabd1c23369bbd22e8a201c9","observation_id":"e7fa8cc1-75ad-43ec-82b9-63bea8c08157","resolution":{"observed_at":"2026-08-07T12:45:46.718839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09601","last_updated":"2025-02-13T18:52:36Z","snapshot_observed_at":"2026-08-15T01:40:51.444222Z","submitted_at":"2025-02-13T18:52:36Z","title":"CoT-Valve: Length-Compressible Chain-of-Thought Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09601","snapshot_observed_at":"2026-08-07T12:45:46.813417Z","title":"Cot-valve: Length- compressible chain-of-thought tuning.arXiv preprint arXiv:2502.09601, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.813417Z"},"links":{"cited_paper":"/paper/2502.09601","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:9da5c7e1299df84efb7b4e1abc89497dcd9b0fdb5cc903025cf0db4a400acaec","observation_id":"14b0b5c8-56d1-4a7d-9f8f-3a8a885a9fb9","resolution":{"observed_at":"2026-08-07T12:45:46.813417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T12:45:46.890731Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning.arXiv preprint arXiv:2501.12570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.890731Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:d4cda27294b42039389b777adec82608a61ff92a24d947155c668d6a163d8288","observation_id":"b9e5165b-591a-431a-a5ed-f3d76ab2ad52","resolution":{"observed_at":"2026-08-07T12:45:46.890731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-08-17T09:15:07.422894Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-07T12:45:46.989840Z","title":"Chain of draft: Thinking faster by writing less","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.989840Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:7613f95a23b838056b9fd3c01223fc34a9f86cf2c5adb587cfcb6027999f74aa","observation_id":"2568004f-7a97-4103-a80f-b990e3e95664","resolution":{"observed_at":"2026-08-07T12:45:46.989840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:47.103317Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.103317Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:abc84308654d26fc3815d819c53785a976c7f03afceb5610e68080fca3923843","observation_id":"42aededb-4303-48bd-8e9c-30030cd75dd7","resolution":{"observed_at":"2026-08-07T12:45:47.103317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-17T12:58:09.299262Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T12:45:47.190857Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning.arXiv preprint arXiv:2504.01296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.190857Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:954d03546e4f098d41fe79af7f387063ff5a970c8e880ebedc01aa7352e25544","observation_id":"bc08dba0-d75b-4fc8-90db-9494c4c596c0","resolution":{"observed_at":"2026-08-07T12:45:47.190857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-16T12:54:38.383893Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-07T12:45:47.270161Z","title":"Self-training elicits concise reasoning in large language models.arXiv preprint arXiv:2502.20122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.270161Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:0f5c6599311708024d08e0ed53ef037956724255b85b698f022d4b29f0561506","observation_id":"d88c928a-1794-4b88-86e6-323e3c1d21b5","resolution":{"observed_at":"2026-08-07T12:45:47.270161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:47.369962Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.369962Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:470e1187bf4a75aa24e18ce3bb5a22786523b6c40bb53b7903d30fac1cc213db","observation_id":"d5f147fd-2b85-48dd-9d0f-711bc0cbc900","resolution":{"observed_at":"2026-08-07T12:45:47.369962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-17T22:02:59.517608Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T12:45:47.521580Z","title":"Tokenpacker: Efficient visual projector for multimodal llm.arXiv preprint arXiv:2407.02392, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.521580Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:67beb3c9b36ded045203716545e80a91d19fbed9cd5f60fd2cc90177d2deabca","observation_id":"2ad7117d-d750-496d-bf95-cb4432bb11c7","resolution":{"observed_at":"2026-08-07T12:45:47.521580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:47.643037Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.643037Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:8f92eca1ddc85c8defee952e75ff04bf2b4a3ca31cb241069877c6f732bf7d49","observation_id":"ee0d314a-5c6d-4fb8-8488-8e40fee127b2","resolution":{"observed_at":"2026-08-07T12:45:47.643037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:47.770684Z","title":"Visionzip: Longer is better but not necessary in vision language models.arXiv preprint arXiv:2412.04467, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.770684Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:f10c12ce43d565178acdf5c5923c99564f1d78f0b5dcdf77864a73548e15989c","observation_id":"a8b5ad51-a5eb-4969-9f15-cc7d751afe62","resolution":{"observed_at":"2026-08-07T12:45:47.770684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10905","last_updated":"2025-08-06T06:52:07Z","snapshot_observed_at":"2026-08-16T12:50:12.601799Z","submitted_at":"2025-03-13T21:39:38Z","title":"Learning to Inference Adaptively for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2503.10905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10905","snapshot_observed_at":"2026-08-07T12:45:50.019871Z","title":"Learning to Inference Adaptively for Multimodal Large Language Models","venue":"cs.AI","work_id":"fa0dc04f-aecc-4c82-b685-a94cfe9801ad","year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.885550Z"},"links":{"cited_paper":"/paper/2503.10905","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:61312beffd6aa5e78f320a8631a9eae7778cdc009af1332df3f56f8689459146","observation_id":"fc00c54a-baa8-4102-a00c-f34c8b0ac5ab","resolution":{"observed_at":"2026-08-07T12:45:50.149770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:45:47.987803Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.987803Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:f253a2800aabbe9cdf5ad2ed711e4e24c616422d8df4644ac91f2ffb085c8708","observation_id":"05fd2193-04e6-4edf-87ed-77bfb4816150","resolution":{"observed_at":"2026-08-07T12:45:47.987803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00025","last_updated":"2019-05-31T18:32:18Z","snapshot_observed_at":"2026-08-14T16:22:50.809495Z","submitted_at":"2019-05-31T18:32:18Z","title":"Minimum-Margin Active Learning","version":1},"cited_work":{"arxiv_id":"1906.00025","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00025","snapshot_observed_at":"2026-08-07T12:45:49.722546Z","title":"Minimum-Margin Active Learning","venue":"cs.LG","work_id":"52675ba4-8c11-4f81-8d67-f420fa27bcb5","year":2019},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.090813Z"},"links":{"cited_paper":"/paper/1906.00025","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:c8dc899660e415d9cdea955c0bf66bd0656bcb3cc3459576b3aea8a984e0888d","observation_id":"e9080b37-d52e-497f-a384-d23c3b099d9b","resolution":{"observed_at":"2026-08-07T12:45:49.840522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-08-16T14:18:11.642801Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-07T12:45:48.207589Z","title":"Chain-of-thought reasoning without prompting.arXiv preprint arXiv:2402.10200, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.207589Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:853ff95c2333e82c9697e314f0797b6b20762207f1b49fbd90232df260cd28d3","observation_id":"55a21d8a-69df-46c6-849d-d76362d7ac9e","resolution":{"observed_at":"2026-08-07T12:45:48.207589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:45:48.336602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.336602Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:f52e96de633cbf742472b86223bd8362dfc040e28ca3393d8dcd6146af9a8881","observation_id":"f1e504b5-8e26-417b-986c-6ce42b072558","resolution":{"observed_at":"2026-08-07T12:45:48.336602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.264719Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"ea8d7e64-1b4f-45ea-b0fd-119355ee2ec2","year":2020},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.453340Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:d9c2c45874be042ab71c24facddab87a4a83c9a29dbf751112474773d63a50b5","observation_id":"0bd56ddb-6426-4bf2-a465-792667874fef","resolution":{"observed_at":"2026-08-07T12:45:52.361036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.058128Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"4292fea3-b67d-49d9-b9ef-8a6735831a92","year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.580296Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:087e70aa3bf1695c2f725cd163ae030d5510ec4a9e6525f6245b8d711a352f52","observation_id":"3e48d4c8-304e-443f-a12c-9202b5c50058","resolution":{"observed_at":"2026-08-07T12:45:52.155138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:51.835524Z","title":"Gres: Generalized referring expression segmentation","venue":null,"work_id":"f69602e7-44ff-4009-b1b6-6d1f926af8d1","year":2023},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.721713Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:5ccaea454cb16335228ae84b36a34aecda8f9d96c9ab25194e97be144a8654bd","observation_id":"cd92b246-cc7e-46fa-96a7-300299d3d122","resolution":{"observed_at":"2026-08-07T12:45:51.959281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T12:45:48.814103Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.814103Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:7010687940eabd81efa0e89cdce397f3465619a97ec9303bff07c34fcf7446e1","observation_id":"c89fc2ea-7041-4cd5-b4f4-0305f4e92a61","resolution":{"observed_at":"2026-08-07T12:45:48.814103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:51.619354Z","title":"Lavt: Language- aware vision transformer for referring image segmentation","venue":null,"work_id":"8445d96e-aadc-4289-ab2b-5f0e32010154","year":2022},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.921057Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:9d89c6a2f690f7d665857294f046170433d0ca8234bf202af296a062c68195fd","observation_id":"92fdd583-08e4-482b-ba24-7947dd364e63","resolution":{"observed_at":"2026-08-07T12:45:51.710334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:51.405560Z","title":"Perceptiongpt: Effectively fusing visual perception into llm","venue":null,"work_id":"5720ce72-6a5e-4e7c-b72d-bf7c6064bf29","year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:48.978262Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:87d962871a6c31e3e7f964a33f23871f0f38ca669b5a43919338ed083639c8a0","observation_id":"ce38aa49-aec0-4121-b092-3fff4802a0c3","resolution":{"observed_at":"2026-08-07T12:45:51.493970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:49.027105Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning.arXiv preprint arXiv:2503.16188, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:49.027105Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:a4ce410cbce17fc5a635f1dbc7ac041066d4ff77f84bcd784a347a7d87589780","observation_id":"15688ab7-2a7c-4dd4-b0ac-c2039a0c824a","resolution":{"observed_at":"2026-08-07T12:45:49.027105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-16T12:41:30.521725Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-07T12:45:49.097448Z","title":"Reasoning models can be effective without thinking.arXiv preprint arXiv:2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:49.097448Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:2e247338a170858d3a22ae5e067cbf0549536d0fc5ea423de87b8b8d69699c30","observation_id":"d9f8daec-e419-4683-a770-7aee54f155c4","resolution":{"observed_at":"2026-08-07T12:45:49.097448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:49.152191Z","title":"Deepscaler: Surpassing o1-preview with a 1.5 b model by scaling rl.Notion Blog, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:49.152191Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:0ed4a438fe7b9fd5c4d3be1de94aaacec4404ce44d622dece981f7baf790d693","observation_id":"3146d7b9-8f90-4442-8c82-8e85a243b33e","resolution":{"observed_at":"2026-08-07T12:45:49.152191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:49.226688Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:49.226688Z"},"links":{"citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:875048172f28fd4982b4d2049ddfe6649d629eefba730cf03d747007acb8883e","observation_id":"8d47115b-baf7-4cf6-a4dc-632836c4a70c","resolution":{"observed_at":"2026-08-07T12:45:49.226688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:45:49.325182Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:49.325182Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:41a1f2458f98cab8bc29831d536ce3f572b2bcbf3ac1fe795eb6e68bc069365e","observation_id":"a459d7db-a80b-4667-86b6-87f82ee0a03a","resolution":{"observed_at":"2026-08-07T12:45:49.325182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:35:51.235009Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 5 inbound Pith citation observations for arXiv:2505.23727."}