{"as_of":"2026-08-23T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5ec2fddc8728a66cf9af86561ec9982ca2dc60573da76185f345ce7ced61f7d","coverage":[{"denominator":101,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:27:40.777286Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:52:50.914242Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:17.974489Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-06T20:45:08.054292Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-21T19:50:41.003158Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.054292Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:a5b932d23285d648602fbb7640035da366254be2f64a46a31d5d86f30c9346ec","observation_id":"6acbc47d-b25b-403a-95df-24f4be8505bb","resolution":{"observed_at":"2026-08-06T20:45:08.054292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-05T12:28:26.818295Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-17T20:52:53.724072Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.818295Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:42aad4002990555eaabfb8fae966fc07825ef636f722b92b497856648ec5c36c","observation_id":"7ca2ec95-3991-4fe6-8abb-0740c4141272","resolution":{"observed_at":"2026-08-05T12:28:26.818295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":"2506.24102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-04T00:49:17.974489Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world","venue":null,"work_id":"e8ee823b-4ec2-4107-9beb-484b8bd1d865","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-16T17:50:54.118450Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:e45115175bb7bbf3025101b52e74abff3386ad48c0ccd64c986b3d797c218da4","observation_id":"4b910caf-778d-4e25-ab97-dccd7d3bea35","resolution":{"observed_at":"2026-05-11T16:01:07.535428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":"2506.24102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-04T00:49:17.974489Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world","venue":null,"work_id":"e8ee823b-4ec2-4107-9beb-484b8bd1d865","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-16T17:50:54.118450Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:839df21d9d7178d755460aefc55ad5f6fca0c4d94220f88577e582029ec53f0e","observation_id":"df075b50-a630-4695-907b-0e677b6d790a","resolution":{"observed_at":"2026-07-01T07:35:28.757959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":"2506.24102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-04T00:49:17.974489Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world","venue":null,"work_id":"e8ee823b-4ec2-4107-9beb-484b8bd1d865","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-15T04:37:27.117254Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:d6dc7406e44c8776905104e7d8aeeb67855b0b81eaf02779266f22c793760786","observation_id":"6d5d9761-0f57-4a1e-915f-e3d09818a77e","resolution":{"observed_at":"2026-07-04T00:49:17.978718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":"2506.24102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-04T00:49:17.974489Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world","venue":null,"work_id":"e8ee823b-4ec2-4107-9beb-484b8bd1d865","year":2025},"citing_paper":{"arxiv_id":"2606.29531","last_updated":"2026-06-28T17:54:55Z","snapshot_observed_at":"2026-08-12T20:40:34.882998Z","submitted_at":"2026-06-28T17:54:55Z","title":"MotionAtlas: Detailed Region Captioning for Motion-Centric Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T07:21:46.783970Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2606.29531"},"observation_digest":"sha256:05711f9a0135f7397b0c46d29ef6065f11e84e5690c0c3eebb2084e57cd8eb7f","observation_id":"221ab060-7b89-4d7f-9c15-25a93ec708b8","resolution":{"observed_at":"2026-06-30T07:24:21.176750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2506.24102 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-18T10:36:05.287669Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:49b1e259e5f902959522ff6a24cb7f3a65ed32b6f85ba651fd133842d5f144c0","observation_id":"dadaec08-c2f2-4c26-924b-69885e6bc720","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-12T10:52:50.914242Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world.arXiv preprint arXiv:2506.24102,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.914242Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:400b8e8642701b2e0d0e3f5c22ce39d1286f2fbca90c5e7827447a43384dff56","observation_id":"08ef701c-714a-4f5b-ae1e-6708a30a4cab","resolution":{"observed_at":"2026-08-12T10:52:50.914242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-12T04:57:29.366022Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-18T01:15:25.484197Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.366022Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:2a8fce979f09c1008f1843f3ae98f13fb089de4127bd81121ef97b1c927d1d73","observation_id":"89047adb-f0dd-4db6-8626-d5c982287beb","resolution":{"observed_at":"2026-08-12T04:57:29.366022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.24102/citation-record","integrity":"/paper/2506.24102/integrity","json":"/paper/2506.24102/citation-record.json","paper":"/paper/2506.24102"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:27:37.747749Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:37.747749Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:bbc048fd617e67344d8e090e52bc6720851b8bb3510ae4e66fb2c7b3ad86874b","observation_id":"a517616d-28d1-4ab3-ab06-c96b2e30ba7a","resolution":{"observed_at":"2026-08-06T21:27:37.747749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-08-16T19:00:33.294322Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-06T21:27:37.800973Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning.arXiv preprint arXiv:2412.09078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:37.800973Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:5e84e7a24275f64f376b828631d666d1d852cdf641fe744af65a284c79775eeb","observation_id":"b7e8f173-a84d-4a68-85be-f207b761ac40","resolution":{"observed_at":"2026-08-06T21:27:37.800973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:37.884655Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:37.884655Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:233ea2ae56bf385361e98e8bc71317f5f9578fd50df48713f0fdc3d7dced9c5f","observation_id":"b9aa99d3-ee94-4703-b2ef-5f43fe6a6ebc","resolution":{"observed_at":"2026-08-06T21:27:37.884655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:37.952668Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:37.952668Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ec030a7ec3c35ef2e645d871365feeb6d9a1cb5f5eff97ebde29213ba11ecc19","observation_id":"0fc68726-06a3-4a0f-8de8-ede79d38e38f","resolution":{"observed_at":"2026-08-06T21:27:37.952668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T21:27:38.026930Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.026930Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:b32fde55c092c46868ba0608306ccb73c7088a02ec739645368441bcc88ce168","observation_id":"f09fa8bd-6a5a-4514-a61f-37094c21544b","resolution":{"observed_at":"2026-08-06T21:27:38.026930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.100032Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs.IEEE TPAMI, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.100032Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:647db3c2c021265ef4fbf3dfe68bddf5bc483317d519fa49cfa4ec53a98f8fd2","observation_id":"009dfa7e-fced-4aa2-b3a9-49c1447514c9","resolution":{"observed_at":"2026-08-06T21:27:38.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.168416Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.168416Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:81e1deabc6c09f74fbdb672bd6dda554287b6740222cc36cd41ade0ce08c39ef","observation_id":"2ab18dc2-767c-4897-a00b-ecbbf5059f1f","resolution":{"observed_at":"2026-08-06T21:27:38.168416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T21:27:38.248893Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.248893Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:3677c2f779c2bdf8076936955037f68af560f5e720c2163b3f1afa1fc0e84cae","observation_id":"6fe10566-430e-4815-a496-2e863bbea96e","resolution":{"observed_at":"2026-08-06T21:27:38.248893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.314179Z","title":"Mmict: Boosting multi-modal fine-tuning with in-context examples.ACM TOMM, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.314179Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:9b6702a426f500765e2817f6d8285eb52163cf796d5ff80ff092c8d98ce26c69","observation_id":"a787fb3e-a4af-4da6-b1a4-471fc396660f","resolution":{"observed_at":"2026-08-06T21:27:38.314179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.387930Z","title":"A generalist framework for panoptic segmentation of images and videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.387930Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:2aed34b92bfd132772dc28f2dccff9fc42889a149cfba996496b68bbbd536e3f","observation_id":"00641be1-9805-483a-a093-d7e1e84f9ff2","resolution":{"observed_at":"2026-08-06T21:27:38.387930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T21:27:38.511775Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.511775Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:eae03e72a73705a5ec663d946a2ff5f12851479a74158b2ec29ea54da0b47f36","observation_id":"97586feb-2cb6-4163-8f29-27f8764a0ea6","resolution":{"observed_at":"2026-08-06T21:27:38.511775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:27:38.683907Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.683907Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:e8cad5754a4e2df9ace6d081ebfc387bb3f849832a9ff3b8a127cce3a364a7a9","observation_id":"6b4d502f-f185-45bb-8f7b-2f7b04494c20","resolution":{"observed_at":"2026-08-06T21:27:38.683907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.755578Z","title":"Lmdeploy: A toolkit for compressing, deploying, and serving llm.https://github","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.755578Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f72f539aec7a34e4c7d32139def47e2675241078c6852961819bac6f1b7f2aaf","observation_id":"e7a9f7ce-d491-4732-9a9f-6a335dee48c2","resolution":{"observed_at":"2026-08-06T21:27:38.755578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.810255Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.810255Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:09d82efbd632a62042a487c14a2d889f76a81fcfb5e6e825fdb7715ce47840b5","observation_id":"41ba3a1d-d81a-4a17-a5a4-0e43e0e5f766","resolution":{"observed_at":"2026-08-06T21:27:38.810255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-14T09:50:00.957608Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.02589","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02589","snapshot_observed_at":"2026-08-06T21:27:41.338540Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","venue":"cs.CV","work_id":"589ff94d-2135-46c1-9ca7-286b33f3ca62","year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.873138Z"},"links":{"cited_paper":"/paper/2502.02589","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8e787a54eeccb1eac5538fc5d01cc47c1fc93af46f94ea88ba1c7bf2dc90e27c","observation_id":"62fa214b-a681-4449-9fb1-8fa7716e92f9","resolution":{"observed_at":"2026-08-06T21:27:41.419910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.919524Z","title":"Open-vocabulary universal image segmentation with maskclip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.919524Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:026037d374865eb94e27d9ed9114701ba565f28217a32ad9d333b8077e53838c","observation_id":"fd30797a-9400-4a4f-a527-d611d4e00e20","resolution":{"observed_at":"2026-08-06T21:27:38.919524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:38.971631Z","title":"On path to multimodal generalist: General-level and general-bench.ICML, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:38.971631Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:88e68021d6c97469a69f65d775ff608a194a9ea8353aae8248980779eb77985c","observation_id":"16b4187a-f9f2-4dd2-acd0-843a8ed45312","resolution":{"observed_at":"2026-08-06T21:27:38.971631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.024891Z","title":"Align-kd: Distilling cross-modal alignment knowledge for mobile vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.024891Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:db48c70177b5e0edd1e67c8c70ef163647911cc0fbacaa67783111a8e52d1c51","observation_id":"251abd9c-bc7b-485b-8c55-f4f2ad9bea19","resolution":{"observed_at":"2026-08-06T21:27:39.024891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:27:39.071048Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.071048Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:866418769b0afbad313d7085b99a6e33ba13543b9697b7929a0d3874cce1c2c5","observation_id":"51ce1e35-c333-4395-a02f-8310e9765c30","resolution":{"observed_at":"2026-08-06T21:27:39.071048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-20T07:59:47.616406Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T21:27:39.153550Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.153550Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:b7a3c8579f507118608d1e50f64abf783d3255c5248c832c9a815fcc3c55f41b","observation_id":"a76d1f1c-6fda-47af-ab42-ef74e8a250c0","resolution":{"observed_at":"2026-08-06T21:27:39.153550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-16T13:55:21.927218Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-06T21:27:39.220822Z","title":"Imageinwords: Unlocking hyper-detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.220822Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:88dd1a4e22758ef1b228f23181ea0d22bd7aba2ada1ce5b88a9307307db28561","observation_id":"865be4a2-489c-47a7-8a66-36dddf56bc2b","resolution":{"observed_at":"2026-08-06T21:27:39.220822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.286090Z","title":"Fast R-CNN","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.286090Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:db5fa9dcc528d8609030a2139c67d987267a78a38fc47b970cbe770541758331","observation_id":"016a5aa5-8bed-4c26-a7d3-c2f018e646f2","resolution":{"observed_at":"2026-08-06T21:27:39.286090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-19T12:24:01.366896Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:27:39.353274Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.353274Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ff99991312d85a26f707f4675efa5dc2a7a91ddde29d9d869941a2aca80d17a3","observation_id":"4a6c5b47-e72a-42bd-911d-b726c8c2e9cd","resolution":{"observed_at":"2026-08-06T21:27:39.353274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-16T13:09:38.876999Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-06T21:27:39.419795Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.419795Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:7452b04073abf5ebc9c46dccb70f4cf27256bdd9d2559be4c4315e04554bf178","observation_id":"8045657a-32af-4ee3-8888-4b699826fde3","resolution":{"observed_at":"2026-08-06T21:27:39.419795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.498070Z","title":"Mask R-CNN","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.498070Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8e82f602b0322179c432e08c8877c6beee38611b0e6b543b27619a0d76ea4664","observation_id":"bad9970e-702d-482e-8bd4-74b851201b9e","resolution":{"observed_at":"2026-08-06T21:27:39.498070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.554850Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.554850Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:e7c8c3ddc657847d7e0837296f57d72ffcdb9c0a393117c96348c526747a7e57","observation_id":"93d3db71-0e2f-460b-82bb-417781bf135c","resolution":{"observed_at":"2026-08-06T21:27:39.554850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:27:39.601377Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.601377Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:adb6fd16a6062b6c176b738d4d61f9000869b64774d7909c8cf3951e28c52e6a","observation_id":"d8d231e1-25da-4d21-9123-7e2fae3108f1","resolution":{"observed_at":"2026-08-06T21:27:39.601377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.661296Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.661296Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:79a417978aeb27539caf7844fbfcec78de7f330ae81c3de27af8181838aa0411","observation_id":"50c4069f-c7d7-4102-b753-1fef9742dde0","resolution":{"observed_at":"2026-08-06T21:27:39.661296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.728999Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.728999Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:0f240bb2f988f8069022dd67a24dafdd2c45d89ae487efa43caa7eaeb378425d","observation_id":"29c7012d-5a25-432e-a20d-80f9c0efde03","resolution":{"observed_at":"2026-08-06T21:27:39.728999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.781933Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.781933Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:2a61a91223883ea96b977d457f4181fdf0bcb7a79ecf7055e6ad29bb80645400","observation_id":"534c5c57-4898-43da-9075-8315e1e35260","resolution":{"observed_at":"2026-08-06T21:27:39.781933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.846250Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.846250Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:6eb3d49ba105c550848d1c090ad75f0fc88df383e78816e977b96c0047b4304a","observation_id":"68249ae9-326c-4e67-9b8c-99e4b686bc31","resolution":{"observed_at":"2026-08-06T21:27:39.846250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.874525Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.IJCV, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.874525Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:c573b20e8532aade16b5a2041093f356f1ce7229664780cd62782db3e501c10e","observation_id":"df4b7773-d011-4f2b-acd7-0cb8d9d5bd2f","resolution":{"observed_at":"2026-08-06T21:27:39.874525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:39.939420Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.939420Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:15680301dd2530ba0e14313155d75cbafa39aca5f028bf90c7bfc6e61c069750","observation_id":"f166d36b-6c5d-49bc-85eb-02739e935b59","resolution":{"observed_at":"2026-08-06T21:27:39.939420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T21:27:39.999572Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.999572Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:133c6e2701ac53ccf861e9aed97a2a8159af7e85cee6abea2df574c3444261ec","observation_id":"c4d373a3-5f0d-4c36-8722-ff613582c522","resolution":{"observed_at":"2026-08-06T21:27:39.999572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.120464Z","title":"Semantic flow for fast and accurate scene parsing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.120464Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f6b692c62fa2906f5fc2e9fb8db99ef719e849d6271d7eb958d05c72b42e44c1","observation_id":"9a1bbaa1-b725-4fdb-8ac9-56aa74993404","resolution":{"observed_at":"2026-08-06T21:27:40.120464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:46.474093Z","title":"Tube-link: A flexible cross tube baseline for universal video segmentation","venue":null,"work_id":"fcde76a9-a552-45b0-999a-95deaa51df13","year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.248247Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ce5adff6f561002f57ed7e556a5c890cdf49c50080f48c3b8d14cb0f18f9cb8b","observation_id":"8dff9c5f-e137-4531-b6e8-dea61f2d7745","resolution":{"observed_at":"2026-08-06T21:27:46.573229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:46.320785Z","title":"Transformer-based visual segmentation: A survey.IEEE TPAMI, 2024","venue":null,"work_id":"16084440-86e5-4ddf-a91a-786405421e13","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.343543Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:b950639c9d41d41ba3009c95f714f7184d311373fca4f9b8249d3b31d6990ecf","observation_id":"3ef0665b-ba69-463a-a227-c9cadcb9cd18","resolution":{"observed_at":"2026-08-06T21:27:46.408374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:46.171077Z","title":"Panopticpartformer++: A unified and decoupled view for panoptic part segmentation","venue":null,"work_id":"78a5ee1f-7e72-4467-a878-d8577824b110","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.396058Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:494c930f60fa60303b974364fa6a109f7d158514c5db1cc1e8ab61e7e2707577","observation_id":"2bbb1d49-443e-4f12-b427-d8766afb237b","resolution":{"observed_at":"2026-08-06T21:27:46.251419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:46.044886Z","title":"Omg-seg: Is one model good enough for all segmentation? InCVPR, 2024","venue":null,"work_id":"91bd90ad-f0bf-4519-a5a5-dc7f5e7683e1","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.510530Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:c5fe0d8b6dd4246b229d99f0e8d078a4ca38cef4b9f3bfaabcc3758ce449b98e","observation_id":"aa89047d-f226-4218-ab42-aecc1f300136","resolution":{"observed_at":"2026-08-06T21:27:46.132288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.914054Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"788a26b9-c402-4f99-8efb-0ad39d91ab9b","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.569012Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:098699290215620b39aa187b3cedd73fb8ee15a6bb7e2b039ab88d10c4f7ca69","observation_id":"527de3c6-b531-4162-927d-0deac90836d7","resolution":{"observed_at":"2026-08-06T21:27:45.984022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T21:27:40.572938Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.572938Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:fe6b063eb6d82d8c8faff0d8d85f2df50e306df777e4d51a7d36dbd1ba4eb3a8","observation_id":"c0790401-28cc-4c64-868e-780d1a674f08","resolution":{"observed_at":"2026-08-06T21:27:40.572938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07124","last_updated":"2023-10-09T03:34:01Z","snapshot_observed_at":"2026-08-19T03:18:22.679345Z","submitted_at":"2023-09-13T17:59:09Z","title":"RAIN: Your Language Models Can Align Themselves without Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07124","snapshot_observed_at":"2026-08-06T21:27:40.576534Z","title":"Rain: Your language models can align themselves without finetuning.arXiv preprint arXiv:2309.07124, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.576534Z"},"links":{"cited_paper":"/paper/2309.07124","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:947259ae6dac358667dd8c41e18e5c05269667554cd1f63a7ea32d51224efe4b","observation_id":"c844c7a3-b105-4555-b89b-bf055ebdeb44","resolution":{"observed_at":"2026-08-06T21:27:40.576534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T21:27:40.580439Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.580439Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:85d7aa8f9d1802daa8b7c36ee7b01212debd8b32d83af9898604a017bc801bd8","observation_id":"598a04af-4759-4cd5-ae13-94be05182c7a","resolution":{"observed_at":"2026-08-06T21:27:40.580439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-06T21:27:40.583636Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.583636Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f7a0234a4a67e91ee92bc3528ee2d47349998796ad9db89e6765342d2f657a4d","observation_id":"88536864-af88-40b0-8df6-7f58519084cf","resolution":{"observed_at":"2026-08-06T21:27:40.583636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.586932Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.586932Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:c3ca5a9878cf4ef3b603f399bdf5f61cb8e9918df33a657c403263b816a278fe","observation_id":"c9ef35c5-618f-4079-a2a6-918379c65b15","resolution":{"observed_at":"2026-08-06T21:27:40.586932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.590167Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.590167Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:43074dec081d1f87a8942a9ae8b6e46b43458acb2b8ecdaa957e1027f89b443d","observation_id":"f685c171-351f-4598-b460-061d8ea477a0","resolution":{"observed_at":"2026-08-06T21:27:40.590167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.593218Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.593218Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:d9082935e2ee9b20accdf4d25fde844806674cc7d03497177fa53433e5bc16e8","observation_id":"b822752f-7f15-4cca-b248-8149c1ddf45a","resolution":{"observed_at":"2026-08-06T21:27:40.593218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.596482Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.596482Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:254be381b48da0a8ba2d3c90ad1e42af7c2e98ce6b4b1dcc161437ea923f5cf9","observation_id":"9e1ecbfb-b11a-4f10-8b8e-68a4c107806e","resolution":{"observed_at":"2026-08-06T21:27:40.596482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.599775Z","title":"Mmbench: Is your multi-modal model an all-around player? InECCV, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.599775Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:bb93a016c7a3af7aa994000871d21ef7e91f86f6404da87342122587cb056031","observation_id":"51407231-9259-4f1f-9ae4-19ccd0cb72e1","resolution":{"observed_at":"2026-08-06T21:27:40.599775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.733649Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models.NeurIPS, 2023","venue":null,"work_id":"6d3b95d1-7642-4965-85cd-f0f2b3d6ec10","year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.602996Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:08eb7e86b07f633ae277e5bca57b69d3db6f2a6f52a58d3fca05f745f0554d20","observation_id":"32d988f5-3633-4586-a7d3-aa50531bf0c3","resolution":{"observed_at":"2026-08-06T21:27:45.818256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-21T23:16:01.799274Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T21:27:40.606698Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.606698Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:634e16380ebbaea533925bfc7d0a36ae1fbf6fa1767277ea4bd96f71f3e14664","observation_id":"771b976f-f12b-4fb9-b996-ba86b6d8470f","resolution":{"observed_at":"2026-08-06T21:27:40.606698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.609983Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.609983Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:82dddf2e88eb6059372e5c29866d5b3903685ec32b3b45729377251fba5802c1","observation_id":"2316f26c-859e-4275-9f75-c4064a8bede1","resolution":{"observed_at":"2026-08-06T21:27:40.609983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-21T13:58:51.559670Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-06T21:27:40.613286Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning.arXiv preprint arXiv:2503.20502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.613286Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:76ba2427f72fbbdc6f33c6c375ede5d4ecaf25150ae761ab60c77d5d35e523fa","observation_id":"5526a603-514c-4ea4-8fc1-32e5e4e3c89e","resolution":{"observed_at":"2026-08-06T21:27:40.613286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.599063Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"1466c235-4641-4bd5-a529-ff24b521a146","year":2016},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.616835Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f2abd09499e0e9fcb23fe5c1b128d29f0345c66bd9886574fea0746d24eeba72","observation_id":"9ac68ac8-901b-4519-9d09-e75b9bcd177f","resolution":{"observed_at":"2026-08-06T21:27:45.643071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.619942Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.619942Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:2bb6a89a52f2dea1e43e0ba1b353812eea6b8d153d33014bfae16d814544dec4","observation_id":"f7a05ce1-34a3-48ad-b0ee-67f2aa27cd0e","resolution":{"observed_at":"2026-08-06T21:27:40.619942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-08-16T13:56:31.060458Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-06T21:27:40.623070Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.623070Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8de37f8bf4d2d26344b1ba68858e4a45c321c451c0ffde5a868e21373a7fb97a","observation_id":"c008511e-efbf-4603-8c3e-76703c2a874e","resolution":{"observed_at":"2026-08-06T21:27:40.623070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.419149Z","title":"Open world entity segmentation.TPAMI, 2022","venue":null,"work_id":"d274fae1-f6e5-46ac-9e18-9d6e10692996","year":2022},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.626880Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:b69f95c9a75fb3f1484faa8a5a84d28501b579cf86a98b6e5f9a9a582d1d486b","observation_id":"1fd29755-a279-441d-b6b5-70abd5885946","resolution":{"observed_at":"2026-08-06T21:27:45.489298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.630136Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.630136Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ac9d6fe511a5e22609bb9de3b9553e871c23d70b19b8aadae6cdb2c055506274","observation_id":"5c6244ae-b38c-4a04-977c-6d7226504cb9","resolution":{"observed_at":"2026-08-06T21:27:40.630136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-17T18:00:27.329541Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-06T21:27:40.633432Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.633432Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:acad2527e75493578753a32335b663ebb4f8eabd2836c8ac67f7518b45bce1df","observation_id":"7305e160-f785-41c6-8060-27508a49775c","resolution":{"observed_at":"2026-08-06T21:27:40.633432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.175312Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"9024c9c8-1fe3-4d8c-9c1d-adaac469d87b","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.637224Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:42589628a328d01f4b2d97eba8f07bd44899e2be4a012804da94ac358e07e106","observation_id":"3ba85684-9f45-4328-81b6-5933120051b0","resolution":{"observed_at":"2026-08-06T21:27:45.259646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:45.006831Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"b449c7a5-03f3-47bb-abd1-fc558dd9e2cc","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.640628Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:40b4283fa8641af4f7e132d8a63f7d45e2a9725e358ddcb06e171d7af7d80df3","observation_id":"f255b326-5382-41ae-9632-a584e9951042","resolution":{"observed_at":"2026-08-06T21:27:45.091819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.643719Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.643719Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:97571d8c77708f0de2f74aab0bcacd279420156f8f97eb3eee719deee8654ba5","observation_id":"b36f3223-e009-45d6-862a-7cb8b8c7cfd0","resolution":{"observed_at":"2026-08-06T21:27:40.643719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:44.801687Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"6e795e23-5a0d-43c2-b909-9ebd5e58cacf","year":2019},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.647008Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:d42967ef8eb4d987496a8877f2a51c62a78d06f3ead1844a33c853311f092bbf","observation_id":"954b9cfb-a9d5-45a8-873d-1cb0b1de4485","resolution":{"observed_at":"2026-08-06T21:27:44.894015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:44.586484Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"718094e4-db91-471f-adf2-60852ec04581","year":2018},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.650343Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8ce79ca1521d289d1ced03934e156b1f5af56d906a0c54e7e1676c9be3d06180","observation_id":"c0c64e1e-61c4-407c-8a01-d765ca784027","resolution":{"observed_at":"2026-08-06T21:27:44.714371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:44.436293Z","title":"Aligning and prompting everything all at once for universal visual perception","venue":null,"work_id":"b7d9cced-3b22-441f-a4ad-f5b569e74f19","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.653930Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:67d9b529eb80a436ce35563a725a06234b8beab25f70212f3f684971dead6ddf","observation_id":"c589784d-a8e1-4873-abaf-3c7373c846d9","resolution":{"observed_at":"2026-08-06T21:27:44.503117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.657128Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.657128Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:4875360ae7a19863f960df3de6466990a4570ff3da1dab8879e9db78f67c831d","observation_id":"506c686c-fa23-4a1e-ab93-1d3509cf6f53","resolution":{"observed_at":"2026-08-06T21:27:40.657128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-20T20:37:36.775968Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T21:27:40.663603Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.663603Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:18ada074b7d4f6f89df4322a4d6a9d59b8454a4be4feacf6bc86b466159d74b8","observation_id":"f811175c-171c-4137-a96b-46026a58ac04","resolution":{"observed_at":"2026-08-06T21:27:40.663603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:27:40.667140Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.667140Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:00f7c8c06b9f95b191c2e055b8bd5ca3a5920feb91b81f93caae0746668790cf","observation_id":"d67485ec-2934-439e-ac44-936fa809d5ec","resolution":{"observed_at":"2026-08-06T21:27:40.667140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.670511Z","title":"Yfcc100m: The new data in multimedia research.Communications of the ACM, 59(2):64–73, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.670511Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:2196de006de099334dc7510ac511ab2a42e670fc9ff4a7a1ee47474e19882d5f","observation_id":"f41b03d3-62f3-4a2d-8e5e-8a54197c346f","resolution":{"observed_at":"2026-08-06T21:27:40.670511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.673570Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.673570Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:0687a8aa87193f2ac0aa51f5f151d4c98cedd5526e10d8c5c667a60ff0694927","observation_id":"8ef410e2-0490-43a0-84eb-156ff7ce61d4","resolution":{"observed_at":"2026-08-06T21:27:40.673570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.676960Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.676960Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:e02616565ce0668efaadaa671ce00db332bea1c5714dfdbfef652aa7f2108bd6","observation_id":"0680ee7b-5ee3-4dca-bb37-4758a8703e75","resolution":{"observed_at":"2026-08-06T21:27:40.676960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20424","last_updated":"2024-09-30T15:49:54Z","snapshot_observed_at":"2026-08-16T13:14:04.219021Z","submitted_at":"2024-09-30T15:49:54Z","title":"World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20424","snapshot_observed_at":"2026-08-06T21:27:40.680175Z","title":"World to code: Multi-modal data generation via self-instructed compositional captioning and filtering.arXiv preprint arXiv:2409.20424, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.680175Z"},"links":{"cited_paper":"/paper/2409.20424","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:8edc1bf8429e6fc4517ad0ba4251e83752a2a11cd876d94c9816c2651a097955","observation_id":"16724b0e-b87a-4a6e-8d44-48b746bfe395","resolution":{"observed_at":"2026-08-06T21:27:40.680175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-15T04:02:04.964450Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-06T21:27:40.684250Z","title":"Vgr: Visual grounded reasoning.arXiv preprint arXiv:2506.11991, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.684250Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:d993b0f37cb43eee3bfc01de45749391485a37f2ac702f94d1dd1aed36752c8d","observation_id":"81f90f83-af06-4238-a2e8-224eff335abd","resolution":{"observed_at":"2026-08-06T21:27:40.684250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:44.194343Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"7441ab22-afb1-4c89-bd1c-abd25c2c54f3","year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.687959Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f52ea8787b899403c7d0c47192291eb8d5d4b26fe0240d9ad18b385923134b20","observation_id":"2bf8c0af-c9e1-4072-8f0b-704c64285cda","resolution":{"observed_at":"2026-08-06T21:27:44.298107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:27:40.690961Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.690961Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:dcb3da87a125726a20e2fbadeae8d69870b2b46e953d24085169eed5be27cdd5","observation_id":"647a6b22-6125-4f2f-b0af-167ba22b114d","resolution":{"observed_at":"2026-08-06T21:27:40.690961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-08-20T18:01:26.884815Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-06T21:27:40.694416Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.694416Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:86ec9a4aa9c55596f5ab09b87c70093e2c15a157b58633dc5855beb1557f1c35","observation_id":"82780df1-cb0c-4b10-a07a-133291ee74c9","resolution":{"observed_at":"2026-08-06T21:27:40.694416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:44.011281Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":"cd069cea-5510-4803-9ff7-3edd21279fb9","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.697874Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:9f3daa2412165e9a554b5fbfb5f771b0807f38ec7f5b25bd1223ad11fa9cd0f7","observation_id":"aba661de-d16a-40ae-87d7-6d2c92714a83","resolution":{"observed_at":"2026-08-06T21:27:44.109470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:43.768900Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"06429acc-521c-49cc-9116-ccc201fc1cbc","year":2023},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.701034Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:49c74f84864b45aaaf64808a546e579ac11d33065f2ca2ac73f4043ce5da9ee1","observation_id":"88921f66-93cb-4832-9e49-5dff9ba3d940","resolution":{"observed_at":"2026-08-06T21:27:43.872751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:43.546000Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models","venue":null,"work_id":"8a0ac520-86ea-4dcc-bb3f-964e74802fb0","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.704032Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:0a876aae4f0df0b73296c77ba2cae11d102136be13fd76fb1672fd0b1bfc56a8","observation_id":"e9caffc3-cc1a-43ad-8d9d-3f12d6fd71fc","resolution":{"observed_at":"2026-08-06T21:27:43.657982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:43.376450Z","title":"Clipself: Vision transformer distills itself for open-vocabulary dense prediction","venue":null,"work_id":"d272f59b-a3d0-4b03-92da-a64f3bba9509","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.707391Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:de46d8e769cc72354ed6363c46eee46681e294607481478455df88578c8cf6eb","observation_id":"b15ec7bb-0d6d-41d0-8242-2680524c2538","resolution":{"observed_at":"2026-08-06T21:27:43.454414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:43.095029Z","title":"Rap-sam:towards real-time all-purpose segment anything","venue":null,"work_id":"cd0c2076-ca9e-4f1e-bf22-36a7334f9ce7","year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.710740Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:f90534910116bcae5ad724e24885d77c2676906c017e5d4ea5a50d1402ead8cc","observation_id":"72ca1fa0-bb09-431c-9aa5-d412737e49e9","resolution":{"observed_at":"2026-08-06T21:27:43.238441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.713811Z","title":"Visa: Reasoning video object segmentation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.713811Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:26a75dad7b1d591cdd9104aefee71a4ffc3442839ba9475fb03f8382fac72b4f","observation_id":"a98feb04-96d7-46e7-a7c4-3a05c5ef5e00","resolution":{"observed_at":"2026-08-06T21:27:40.713811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T21:27:40.717044Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.717044Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:329bcaaae63863df0c5dfc0915ab6ce62d836fa68327ff794e0a9a322988ba74","observation_id":"dd6effe2-2bfd-4abc-9883-c49562682499","resolution":{"observed_at":"2026-08-06T21:27:40.717044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-13T23:14:19.264762Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"cited_work":{"arxiv_id":"2501.13893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13893","snapshot_observed_at":"2026-08-06T21:27:40.903460Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","venue":"cs.CV","work_id":"e8a73f56-63a6-49c3-867d-281eb9d6ca22","year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.720476Z"},"links":{"cited_paper":"/paper/2501.13893","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:35bada04b7031ca28140559777fa5ba12ef1d8e77027c23456cc7c87263b07e4","observation_id":"78b64d86-590e-4d39-80fc-683b7a182919","resolution":{"observed_at":"2026-08-06T21:27:40.909214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.723869Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.723869Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:11b240c27e20d114edc53a19778ea39a6b465ae55111eea6a1040781e6de4eae","observation_id":"84d75ca1-68f0-4293-8cbe-8421400fde0e","resolution":{"observed_at":"2026-08-06T21:27:40.723869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:42.874654Z","title":"Polyphonicformer: Unified query learning for depth-aware video panoptic segmentation","venue":null,"work_id":"d2927fd8-f3a5-44bc-975e-1d0c924f820d","year":2022},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.727389Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:315469303d9231b775acd2cd98b47d31de539c06aa6e1039f7b586d4bbf8c00e","observation_id":"2dd084ac-2f01-4ffe-b665-98d5ac0b23c5","resolution":{"observed_at":"2026-08-06T21:27:42.948227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.730926Z","title":"Open-vocabulary sam: Segment and recognize twenty-thousand classes interactively","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.730926Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:51f03bf1a61b55d802184d800d506c673409524d236fd4e6001ed410c4596792","observation_id":"326cc963-2d20-4580-ae9d-90299834ae37","resolution":{"observed_at":"2026-08-06T21:27:40.730926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-06T21:27:40.734553Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.734553Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:44ddd6ba31c67368035e8251ec33e9e2a76c71eb5c73c873d48594f9656d1143","observation_id":"91968c22-12af-4077-a3ca-2209fb457c4e","resolution":{"observed_at":"2026-08-06T21:27:40.734553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:42.599222Z","title":"Instruction-guided multi-granularity segmentation and captioning with large multimodal model","venue":null,"work_id":"c40cf076-adeb-43c0-a321-c94c09157043","year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.738303Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:49110512b8dffac0c81754f5f56a300cfe1c96c274e6e9d31e22e15caca109cc","observation_id":"b4f3a023-64e9-4de3-af38-b4f4e40c4ee9","resolution":{"observed_at":"2026-08-06T21:27:42.738685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:42.351535Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":"3c881300-124f-47f7-8d01-cb02942d5085","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.741516Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:11c2561de073dd778bb376bd1e42966847c1cc9ac0c691725bf6f1cc5fbde0b4","observation_id":"4217cfe9-f7c7-46c7-afd9-3e655ee88f6a","resolution":{"observed_at":"2026-08-06T21:27:42.489058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.744822Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.744822Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:845683537df0298b25e91264602563f53310701886a6c67685b89cddbb294351","observation_id":"6584a801-5585-4a28-945b-44b6f37e66e2","resolution":{"observed_at":"2026-08-06T21:27:40.744822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:42.081690Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"214c40c7-4ca1-479e-bcf0-918e48cb9c98","year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.748210Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:509f18cd928f7bff196a2cb1742c893ca106a609f8ff1b4b91650c785857bef1","observation_id":"975c5b05-e79a-4591-9cf7-cb0d3a5778e9","resolution":{"observed_at":"2026-08-06T21:27:42.234512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-19T13:42:49.626351Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-06T21:27:40.751792Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding.arXiv preprint arXiv:2504.10465, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.751792Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:440c863c042f6ec10876035fe92fb705d630dd35cea0bb77b56af66dff9a7ecb","observation_id":"925c7ed3-2ea6-488a-9936-4a04bdc85585","resolution":{"observed_at":"2026-08-06T21:27:40.751792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-18T12:56:24.009168Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-06T21:27:40.755138Z","title":"Seeing clearly by layer two: Enhancing attention heads to alleviate hallucination in lvlms.arXiv preprint arXiv:2411.09968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.755138Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:3963b1fe374ed34e377e7b26eec71226dc9ef7af1e8456c7353ff2b705a11c3a","observation_id":"85e6f998-a196-4e31-9939-9d1029a12a5b","resolution":{"observed_at":"2026-08-06T21:27:40.755138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:41.835182Z","title":"Enhancing multimodal large language models complex reason via similarity computation","venue":null,"work_id":"f8786349-7f0e-4730-b475-80f39aef211a","year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.758700Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:02d59a0d406fef7cead92f1e869706e6e32b695cce72979be5f5aa6e34685cc1","observation_id":"1e69aa0b-f4c7-4968-b170-7e020521aa24","resolution":{"observed_at":"2026-08-06T21:27:41.966261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-06T21:27:40.762326Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans?arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.762326Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ff04964fdc999c73a53799550876639ebea113db77fd00c368f7d5cfec09c635","observation_id":"176d8e49-9d01-4eae-b0d3-8f678ab40867","resolution":{"observed_at":"2026-08-06T21:27:40.762326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-06T21:27:40.766319Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer.arXiv preprint arXiv:2412.13871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.766319Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:5e53d3718aa3de05b36505d9d4d2393f6d5b1f1736098dbfac72ae26b891cf25","observation_id":"3f7e994b-b245-48c3-bdd9-998ef8bb5e91","resolution":{"observed_at":"2026-08-06T21:27:40.766319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:27:40.769992Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.769992Z"},"links":{"citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:514654dd88c3ee7549a6b250d078402b1d571500c89174888e10c1fe58c4b120","observation_id":"21a32f5d-15ab-497f-9a92-3789a304f80c","resolution":{"observed_at":"2026-08-06T21:27:40.769992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T21:27:40.773704Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.773704Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:98cd713b076c73262dc0cccd6e62efc5cde092a3e781d7f0be1ed7417b371c61","observation_id":"004cad2c-8fb4-4b9f-9cd6-db5b66514477","resolution":{"observed_at":"2026-08-06T21:27:40.773704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:27:40.777286Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.777286Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:e96a8dfbb261e60d9fc55a9076a0af0117ddc761b2654d5d0df0e4efd65353df","observation_id":"8878ef5f-2876-42fe-ae8d-403b1ca08e06","resolution":{"observed_at":"2026-08-06T21:27:40.777286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":101},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 9 inbound Pith citation observations for arXiv:2506.24102."}