{"as_of":"2026-08-10T11:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9f0308ad5164f3588787aa9b6fbe0da718c98662827c83dc470f5ac90782b87","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:43.126490Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24025/citation-record","integrity":"/paper/2505.24025/integrity","json":"/paper/2505.24025/citation-record.json","paper":"/paper/2505.24025"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:43:38.156625Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.156625Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:879dbb2a2e537966c851960fd724aa9dea8dc49f8290712a1b564c189f458ce3","observation_id":"a7fa3421-7e9e-4cd0-ad68-5d7b237a90b2","resolution":{"observed_at":"2026-08-07T12:43:38.156625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:43:38.261189Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.261189Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:396599b79fabea23d7558b46fbff00eac26d17c261b0b163ca0a00ee84ce8060","observation_id":"b4ecf9c9-bc7b-4d08-8601-fb38be14cdfb","resolution":{"observed_at":"2026-08-07T12:43:38.261189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:43:38.390073Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.390073Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:215266b80970c20076242744a5d0037c39964a14c6d33ee267aa0ea4d62e58ee","observation_id":"bb8a39e6-f4c2-4445-97de-695c4cf08d6d","resolution":{"observed_at":"2026-08-07T12:43:38.390073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:43:38.493697Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.493697Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:7988df522cefb2d36f3eaf3bdb89c0203a4aa9976b01776c24a246a23d693d2b","observation_id":"4eb85102-92d4-4566-b328-cb88248aed08","resolution":{"observed_at":"2026-08-07T12:43:38.493697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:43:38.629796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.629796Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e50bc06db5e9e484ce49406749341684bd9f990980e36134fbdd4d1ddb14f859","observation_id":"d29c3809-a7bd-40d4-a555-ef565faded41","resolution":{"observed_at":"2026-08-07T12:43:38.629796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T12:43:38.746391Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.746391Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:356a0fe82dd1d46eda94802f7205fe102505c9671a50a63f89e2851a5d16ffaa","observation_id":"33e50349-0dd1-4cca-b99c-0339394e082a","resolution":{"observed_at":"2026-08-07T12:43:38.746391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T12:43:38.859878Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.859878Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:502352a3b8a0e0ce1b210e580750eb55d2e21278aa4504c9d0d7236c3c369117","observation_id":"a067b816-b85d-497d-8084-7155d5c6def3","resolution":{"observed_at":"2026-08-07T12:43:38.859878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:43:38.902531Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.902531Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:eee7d97d01276e7acd202b14253f1e36cdbf996ad3fdf2b08b22ec0229118440","observation_id":"cb988395-0cfc-42b3-9717-fa3fc90fd8fd","resolution":{"observed_at":"2026-08-07T12:43:38.902531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:43:38.970665Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:38.970665Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:349a5b93d8f2399c5abaaa4dec10727fe799df56f0de8a2f2d4f9b5ebc22e13c","observation_id":"e41cc792-baac-424c-a1fc-20f44a7e3636","resolution":{"observed_at":"2026-08-07T12:43:38.970665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.038626Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.038626Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:90d57f6964a6eaa04497a7dca4ada974eafbea7c57d66bb105dd5c2275a7cc8a","observation_id":"0050adac-68c7-4a78-ad03-b15c7ce21f64","resolution":{"observed_at":"2026-08-07T12:43:39.038626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.094947Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.094947Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:fa2fde3000660c6203a27409c0e14d7ca7f900b8628179ffe01a76efdf7abc6f","observation_id":"b9a6c6ab-b501-420e-8a4f-927aaaa92e05","resolution":{"observed_at":"2026-08-07T12:43:39.094947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:43:39.167283Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.167283Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:c94bc2693e09f2b2222d6f5d6e14137ff696e78f8ee9db602470482db1a0eb0f","observation_id":"e0991557-f1d0-44cd-899e-fa00cafaf8d3","resolution":{"observed_at":"2026-08-07T12:43:39.167283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-07T12:43:39.233737Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.233737Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:7bb04906ff164ecefc94d67d99d2dfd491664d62411abf860921a1f015666ca5","observation_id":"5c9bfed1-f09b-4e01-8ef0-5f4d300276f4","resolution":{"observed_at":"2026-08-07T12:43:39.233737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.298980Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.298980Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e750be251181f69a6b2f9f66f6e0b0cea7b100296a2ddadec82ef8a8daf37714","observation_id":"66406ad9-3fa3-4b00-9c68-4f52956ca41d","resolution":{"observed_at":"2026-08-07T12:43:39.298980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14347","last_updated":"2025-05-15T15:52:39Z","snapshot_observed_at":"2026-08-02T17:35:50.132599Z","submitted_at":"2024-11-21T17:42:20Z","title":"DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14347","snapshot_observed_at":"2026-08-07T12:43:39.392644Z","title":"Dino-x: A unified vision model for open-world object detection and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.392644Z"},"links":{"cited_paper":"/paper/2411.14347","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:230164eba00dc4b31d46fbb4c27531fafb0398a03255d8546de20de352e58c06","observation_id":"7f08e0fa-4254-4761-b8a1-c7ffb6ac8e98","resolution":{"observed_at":"2026-08-07T12:43:39.392644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.969076Z","title":"Visual in-context prompting","venue":null,"work_id":"2c4835dd-cd4f-4145-8ab0-f0afcfed115b","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.501161Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:4d506fd91593571ff73e03ebb390192f9b8a59909c0dae7745b384898930db70","observation_id":"c05c271e-7514-4b73-874f-6de89913f62b","resolution":{"observed_at":"2026-08-07T12:43:46.051518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T12:43:39.596806Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.596806Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:77fa8afa572b3e72f4f060f2b82052bbac11d503fb6cc8ce40cf6d4fad248366","observation_id":"9e1ad738-9420-425b-a973-25c6ab61b52d","resolution":{"observed_at":"2026-08-07T12:43:39.596806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.690023Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.690023Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:146473d18e6fe0acc12d6accb79d0ad5dcf6971efc0ba063f4e359b0e46f6081","observation_id":"704b60cf-de98-437a-8e4d-430091d07f43","resolution":{"observed_at":"2026-08-07T12:43:39.690023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.743576Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.743576Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:f0c42d62f3c8c22e86744674116dac2d34bac96fd9b687aeb7ef3cbd4424e99f","observation_id":"662ab28b-6bef-4529-b622-eed32a677db4","resolution":{"observed_at":"2026-08-07T12:43:39.743576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.812688Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.812688Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e109d5b648f7307de907c97d021694cfd668dbf3d67ecd83ba48d1b5e6e549d9","observation_id":"a4030498-18b2-404f-801d-ebf925e00178","resolution":{"observed_at":"2026-08-07T12:43:39.812688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T12:43:39.891022Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.891022Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e54edc35eadf943a938dfbe8b83699951a0f20ca09696566767bb80d66a099d9","observation_id":"ae087a71-c295-45c0-b2f2-1221703ca4cd","resolution":{"observed_at":"2026-08-07T12:43:39.891022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:39.964947Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:39.964947Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:613ecc3f2f5a4242cbc68e814d0de7f79276f151d344c89ef7df38921dcd4ba5","observation_id":"5f9ef87f-503d-4289-b3e4-5f2af612fbb1","resolution":{"observed_at":"2026-08-07T12:43:39.964947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.883305Z","title":"G-simclr: Self-supervised contrastive learning with guided projection via pseudo labelling","venue":null,"work_id":"5bb2626a-7f78-46fb-9ed0-c1573897a1c2","year":2020},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.061380Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:94a432b7e89fa4b2cc5a1acc722ce1e4872832d44330e9a99749ad050c75236e","observation_id":"b477893c-00b4-4249-93b3-d4d253260570","resolution":{"observed_at":"2026-08-07T12:43:45.911668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13596","last_updated":"2023-11-22T18:57:24Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T18:57:24Z","title":"T-Rex: Counting by Visual Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13596","snapshot_observed_at":"2026-08-07T12:43:40.179541Z","title":"T-rex: Counting by visual prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.179541Z"},"links":{"cited_paper":"/paper/2311.13596","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:5638bcc3bb8f04f7d4827dff7fcb45d73be726a83dcb1a371e0d42ee0de9085e","observation_id":"d06069fb-48f5-4f1e-ab3f-1f9a3a56e64b","resolution":{"observed_at":"2026-08-07T12:43:40.179541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.762257Z","title":"T-rex2: Towards generic object detection via text-visual prompt synergy","venue":null,"work_id":"66bf5cc9-2d83-4f00-a1c4-7ffa90601fb6","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.294747Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:2aa4b24639e5f75d189992e5cee1725067c7714e1afd05145e82a40bbb75740e","observation_id":"73714e8e-8a42-401a-9e20-194a605f915e","resolution":{"observed_at":"2026-08-07T12:43:45.840820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.698071Z","title":"Cp-detr: Concept prompt guide detr toward stronger universal object detection","venue":null,"work_id":"ae2ca8a0-9821-43d2-91d3-bf98a06ad86e","year":2025},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.365687Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:be8d93ce3ad68a66680aa1bb57b8d1a60cd8c53c03cea35eaf08068c5c6be072","observation_id":"9f2710a2-c5df-456b-9f9d-9ec81e47460f","resolution":{"observed_at":"2026-08-07T12:43:45.729040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08381","last_updated":"2024-03-10T19:00:00Z","snapshot_observed_at":"2026-07-06T16:31:56.083710Z","submitted_at":"2023-10-12T14:55:31Z","title":"AutoVP: An Automated Visual Prompting Framework and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08381","snapshot_observed_at":"2026-08-07T12:43:40.486017Z","title":"Autovp: An automated visual prompting framework and benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.486017Z"},"links":{"cited_paper":"/paper/2310.08381","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:c67f3582d5f7741e01ba512766bf6a76fdc35bb5d28e1fa557ac8d179815a7dc","observation_id":"4a7b5899-47f8-49a3-81a4-9ccbbd8385d4","resolution":{"observed_at":"2026-08-07T12:43:40.486017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:40.605490Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.605490Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:53a50f53c8c4d316dd27b5e92332514bff6c81c0ecf1eb4bc4446f6fbec8cb38","observation_id":"a2913642-ecaf-4e01-92af-966cba330f9e","resolution":{"observed_at":"2026-08-07T12:43:40.605490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.476002Z","title":"Multimodal prompt perceiver: Empower adaptiveness generalizability and fidelity for all-in-one image restoration","venue":null,"work_id":"c7ffbb51-bfa5-4bd2-a21a-dc428661b2b1","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.702290Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:03a2ba73f4053c9c2edd63c99ab2edc978b9b87b4968990345ef42705d7b373a","observation_id":"d1b9627f-cdc5-49b7-b38f-e8d6f1209201","resolution":{"observed_at":"2026-08-07T12:43:45.601553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-07T12:43:40.833021Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.833021Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:03ff445612030a5ebeb0734525fcdeb663c583e0d146f29e0b4b2167fbd8140c","observation_id":"af1f007e-283e-4536-b106-f94e0420e065","resolution":{"observed_at":"2026-08-07T12:43:40.833021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.371259Z","title":"Prompt engineering for zero-shot and few-shot defect detection and classification using a visual-language pretrained model","venue":null,"work_id":"c6b0effa-45b9-4ccf-a6db-3c90d70acc4b","year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:40.955884Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:258cb8c819ba45b2d1907d4e9b6ba1d2accdc1cdac2da23c68323b736f641dc4","observation_id":"2ef018e4-7d7d-4683-a8c9-2f0605bf3126","resolution":{"observed_at":"2026-08-07T12:43:45.422370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.242282Z","title":"Promptcharm: Text-to-image generation through multi-modal prompting and refinement","venue":null,"work_id":"f901115d-4386-4055-8774-885906934e91","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.022941Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e771cf3e974d7155006a00580b79ab77cfc77b3157679fb3345d59023f8923ca","observation_id":"8a1757fb-0847-4a57-b776-379e6a3ef43b","resolution":{"observed_at":"2026-08-07T12:43:45.316318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.202030Z","title":"Prompting industrial anomaly segment with large vision-language models","venue":null,"work_id":"25eee40c-8b84-4ce5-b404-ee8cc0c43cd6","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.126318Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:b0240d8d97dfc76f4e1bbfee0779775b4e7592432af9f807b24f7e41e8697391","observation_id":"f161193d-fc2f-4a2c-aea5-812bfbab78d8","resolution":{"observed_at":"2026-08-07T12:43:45.217572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T12:43:41.257873Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.257873Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:325cd6215c3bbf3397b132d73e364236eb398bf864d63dc95430b2ee8d4e1097","observation_id":"a40d6278-33db-482d-a494-cb1094d91504","resolution":{"observed_at":"2026-08-07T12:43:41.257873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:45.065274Z","title":"Understanding and improving visual prompting: A label-mapping perspective","venue":null,"work_id":"f2cb80ef-f62c-481c-921f-f37df3836fbd","year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.378888Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:ae1353e679b3d3d7f65d008bdf59bf08905e5ad9593ce0de57f73972e6697016","observation_id":"2b52cc8c-8fb5-46f8-8fb8-5630793c7e8c","resolution":{"observed_at":"2026-08-07T12:43:45.134917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.865814Z","title":"Vp3d: Unleashing 2d visual prompt for text-to-3d generation","venue":null,"work_id":"bde0fa60-e4a0-44ab-b51d-90247c085bb8","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.458839Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:089f07b9945c474179fd3781c6423f715af927af275ca75a43ec809cc77338bd","observation_id":"011313bf-cbfa-42f9-ab5a-d3ee850c0512","resolution":{"observed_at":"2026-08-07T12:43:44.952477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-10T09:35:36.209692Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-07T12:43:41.549563Z","title":"Grounding dino 1.5: Advance the\" edge\" of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.549563Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:1dcce92909d13bac74a07cb090eb4dc751477a814867540be78a40884384c729","observation_id":"b35e5bdd-f5c5-40c4-907c-40339020a79f","resolution":{"observed_at":"2026-08-07T12:43:41.549563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02361","last_updated":"2024-01-05T06:21:19Z","snapshot_observed_at":"2026-08-09T12:00:25.208070Z","submitted_at":"2024-01-04T17:00:49Z","title":"An Open and Comprehensive Pipeline for Unified Object Grounding and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02361","snapshot_observed_at":"2026-08-07T12:43:41.692788Z","title":"An open and comprehensive pipeline for unified object grounding and detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.692788Z"},"links":{"cited_paper":"/paper/2401.02361","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:bbb2f8f5e25f3f5637eccb474fd27e697402bb6976a27a8305bcf7782ddc3895","observation_id":"1efe85d8-c42e-4f8a-a403-3af50ae9eedf","resolution":{"observed_at":"2026-08-07T12:43:41.692788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.675092Z","title":"Learning to prompt for open- vocabulary object detection with vision-language model","venue":null,"work_id":"f0186e67-9aab-4d2d-bf5f-72c0b1590127","year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.798426Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:02fe9776908a97340a370129f93076c7b84e8d8a97a7d54a6241fdbec4aa5e42","observation_id":"ee2b72e2-a38b-4cb5-8332-77c425c04928","resolution":{"observed_at":"2026-08-07T12:43:44.738724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:43:41.874245Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.874245Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:c48afbceb289ea33645cc99cd5abda22556c6f978df5ffc464c74bb9c4393c98","observation_id":"3660d5f6-6942-4fb8-b902-dd8dce926aff","resolution":{"observed_at":"2026-08-07T12:43:41.874245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:41.985819Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.985819Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:984fdc477d42418ed16af0da7f8d1f0a3eb08d44fafcccc071394be98bf03ce4","observation_id":"d96daeee-c489-4fa0-b0b0-53c03e340c5f","resolution":{"observed_at":"2026-08-07T12:43:41.985819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:42.119299Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.119299Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e607c6d2c78871c9909df4b805a88a9932b04ba82b47ce8f39099dd34243f51c","observation_id":"187d8867-3352-42a4-8935-d9094727e887","resolution":{"observed_at":"2026-08-07T12:43:42.119299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:42.236006Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.236006Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:931ee1c55827359e2434b55338b1c93c2f1e10bc3d801649f417fd3b8843f96c","observation_id":"dd638852-dbbf-4862-ae9d-ad64d68c96b5","resolution":{"observed_at":"2026-08-07T12:43:42.236006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T12:43:42.302476Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.302476Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:5ed389f1f493cd6b14ae04cf040a240ea7e84f03e07e855b67f9719209861a61","observation_id":"5d3c849b-b1d9-4e16-a256-ce0158fff4bb","resolution":{"observed_at":"2026-08-07T12:43:42.302476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:42.362469Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.362469Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:e638e7997c546c72a3bddd4f77feb16f5a9ae66b188d89a7c75aed5d4a75e4d3","observation_id":"be4cbdb3-a54b-421d-bb99-570a88d2ebf7","resolution":{"observed_at":"2026-08-07T12:43:42.362469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:42.418637Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.418637Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:0b9e758a003732e9684053aea68a4309fe4e27e9e22f6dd5ae95545004ae5dba","observation_id":"3f019d7f-0cb2-411a-8a18-fd4273d538d0","resolution":{"observed_at":"2026-08-07T12:43:42.418637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:42.491065Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.491065Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:251365f7000e50906700a5ffb01ea3d7fb8e6aa6f0e9f8b4b1c41dc824c3380f","observation_id":"4e5b519a-8bbb-4317-ac31-80c6cddfb1cc","resolution":{"observed_at":"2026-08-07T12:43:42.491065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T12:43:42.554071Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.554071Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:9d03908a0e33bd29a625b8e8a7abb0e09e407e21a2468f93d604a50c9f611ebe","observation_id":"3e583b6b-35c1-4fc9-a44a-a84b6bbd4f35","resolution":{"observed_at":"2026-08-07T12:43:42.554071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.553711Z","title":"Yolo-world: Real- time open-vocabulary object detection","venue":null,"work_id":"2f46c572-8a1f-48f2-a042-7f1993bc5689","year":2024},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.632729Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:96c9d872804c888572279347392d874d646f5f863aa29d10fa5cb3696704e79d","observation_id":"0325b4b6-57f1-4fb1-b1e2-5125694fc982","resolution":{"observed_at":"2026-08-07T12:43:44.581367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.414343Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"3b10a081-166d-4986-8551-65e6b66bdb8e","year":2020},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.690710Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:f96f90751b199564187a8ab72d88a8375fda607c148a888f10435a5bdae6644f","observation_id":"beab8506-1c34-412b-8baa-9a6374c7213c","resolution":{"observed_at":"2026-08-07T12:43:44.490030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.297941Z","title":"Dn-detr: Accelerate detr training by introducing query denoising","venue":null,"work_id":"0efc7d27-6433-4adb-8668-f7c927e324e9","year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.749116Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:162f9fca8bbf8fd091cf76acb443245bb03ad5c8033e86ef20441b2931d6322b","observation_id":"ce2b969e-c6cb-44f4-9c79-594a261c9621","resolution":{"observed_at":"2026-08-07T12:43:44.346485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-07T00:53:53.250783Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-07T12:43:42.812679Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.812679Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:9cfb4769d65c8867872481823f4c34d45d4b0d118fe98a6bf211ce2d41479ddd","observation_id":"bab7b3c6-915c-4f98-ab1c-60e8a3c80c80","resolution":{"observed_at":"2026-08-07T12:43:42.812679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:44.041062Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"f5a067a4-7e0a-43c6-8952-af2b1181ef9c","year":2022},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.850234Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:c572b8a1b50f479f9012922adba308b35b93c876cdc931d89077abd34761c0f8","observation_id":"e6b29265-bd35-49d5-9570-0c7116e77fe6","resolution":{"observed_at":"2026-08-07T12:43:44.203328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:43.865750Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"178add19-1f93-48bc-97b2-210621a37840","year":2021},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.909379Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:3baa56714f9aa7dca63c782af36330d2e17b72a3251ef522bea7cd3713c37b95","observation_id":"8ee742f9-e387-402d-9859-1ce46891a8d3","resolution":{"observed_at":"2026-08-07T12:43:43.935458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T12:43:42.949925Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:42.949925Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:21ebed5773d8ba1f09d36b793bbfec6a5d6d2fe26c0f661ba1860d2818b7145b","observation_id":"6c86923d-74a5-40fd-8a62-21503d1aa8c2","resolution":{"observed_at":"2026-08-07T12:43:42.949925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:43.729134Z","title":"Open- vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"0a121fa5-a5f8-4d61-b2b2-941769039da1","year":2023},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:43.017255Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:c2338ba91f5e23ca83bb2fbbe46c6de185780323bf26d6216f57c4d686352803","observation_id":"0534f1ae-8262-4bb0-b7cb-0844e041a973","resolution":{"observed_at":"2026-08-07T12:43:43.786937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:43.064774Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:43.064774Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:92a545dd9e5012155062622d6fecb235c0e97eab567089f386debf2347e818dd","observation_id":"12105216-6a32-4a2a-8378-39d2edc7625f","resolution":{"observed_at":"2026-08-07T12:43:43.064774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:43.531753Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"ff8eee88-3e10-49b0-b23e-d81556849cf3","year":2019},"citing_paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:43.126490Z"},"links":{"citing_paper":"/paper/2505.24025"},"observation_digest":"sha256:98d2b673dd49a993a1bd53579796c15470df34fd27fc5e053097dabb5993648d","observation_id":"7126fe7f-fbd2-4ecc-9a7a-d89e7ebb504e","resolution":{"observed_at":"2026-08-07T12:43:43.605224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24025","last_updated":"2025-08-01T10:10:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T03:45:07.977069Z","submitted_at":"2025-05-29T21:58:06Z","title":"DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2505.24025."}