{"as_of":"2026-08-16T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04d48a78fa35e410e47cc4db67cca11622b94d978167464cbc8bcb6c56b60857","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:20:41.385870Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18300/citation-record","integrity":"/paper/2507.18300/integrity","json":"/paper/2507.18300/citation-record.json","paper":"/paper/2507.18300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.326747Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"de43234c-fb3b-4fd8-a1fa-5f7805386208","year":2022},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.111541Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8fb6f2e1dda4d330662f36504249db50d913491142e607f85067e6c4a9b3c8ad","observation_id":"58ed4f22-b4f8-40ad-a4d9-359276a652bb","resolution":{"observed_at":"2026-08-15T18:20:42.331412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T18:20:41.118189Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.118189Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:748b9c92f0c360875317f8a4d7e1b844300acfe938174753419ea4f2961bd29d","observation_id":"27805ef5-c316-4dcb-8327-ef1aafee5b34","resolution":{"observed_at":"2026-08-15T18:20:41.118189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.311019Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"e4525630-37fc-4735-9521-658de57694f7","year":2018},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.124440Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:2900cd46db981c89a8eb626a0a8e217fcda613708e869c35e2e438da4ba7b60f","observation_id":"c03da974-5d73-4943-9c95-182c33f9a3a4","resolution":{"observed_at":"2026-08-15T18:20:42.316592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.295976Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"73e14cd4-c614-46c0-b875-31ec370c868e","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.129824Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c6b17cbfc748103256f65dcabb793f029fbea10fb10105cc903005bd135bc8bf","observation_id":"d6888f5f-6120-4b14-bb59-2471112cb795","resolution":{"observed_at":"2026-08-15T18:20:42.300835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-16T15:35:02.794343Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-15T18:20:41.134807Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.134807Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:219f12889c8dd0dc9fa94d8491527a59aa773a0affdda3b6454b54e126bcf944","observation_id":"9d2577a7-ffdb-4c06-a5e5-63e52e641ca9","resolution":{"observed_at":"2026-08-15T18:20:41.134807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.280461Z","title":"Allava: Harnessing gpt4v- synthesized data for a lite vision-language model, 2024","venue":null,"work_id":"e7e3d563-a9e5-4c99-9ad9-6e8f3423bd2c","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.140378Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:6db3f8bbde135425b373c8bef36ac2d37413bb23638d779835893264b43e4d16","observation_id":"5d46851c-81b4-46c9-a20b-822e1986d547","resolution":{"observed_at":"2026-08-15T18:20:42.285513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-15T18:20:41.145863Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.145863Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:b9157d3c445726e1bfac966611a8106b9682ee7ae8e0ae437c79fc2567ea7536","observation_id":"5d0fbbc1-6be6-4921-b7d9-c4527c2acd88","resolution":{"observed_at":"2026-08-15T18:20:41.145863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T18:20:41.150411Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.150411Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:e0c77c10e2f5b33c12fc0d0dccef9cccc816ba5e98269604deab2c94865e4898","observation_id":"f2681c6b-841a-4a05-95db-0ff91859d98d","resolution":{"observed_at":"2026-08-15T18:20:41.150411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.155155Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.155155Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:b7cef84044eb4c7c2ac748b4675b596921600a29293df1edbb40fe8c50aa45f3","observation_id":"a80e0917-a2be-41b4-a030-a1668d3b4f21","resolution":{"observed_at":"2026-08-15T18:20:41.155155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.159873Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.159873Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:5105b49a6ff7ffa12c18ee23adfad5e4551e97412d9e197f6bafe93e2c3b5dd3","observation_id":"d39d1c4f-789e-4370-bc1d-855a369de980","resolution":{"observed_at":"2026-08-15T18:20:41.159873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-15T18:20:41.164283Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.164283Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:5400412b722eb4c87f1ca50a5884c8625d15d38d39ba455b2821d58fe7f257e0","observation_id":"344af88c-0b80-4af1-9c1c-219d6367009c","resolution":{"observed_at":"2026-08-15T18:20:41.164283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-15T18:20:41.169091Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.169091Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:1b12a953a83c80618cb87f1ed665969f299292dd65323edc3e3f1adc0e41010a","observation_id":"35d22764-04c0-456f-8ac3-6dd7db62aadc","resolution":{"observed_at":"2026-08-15T18:20:41.169091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.243941Z","title":"Salience detr: Enhancing detection trans- former with hierarchical salience filtering refinement","venue":null,"work_id":"cd400280-9563-4595-b2e5-3eb78c566003","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.173863Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:9e06c215ac4aa89c46baa3ef0e0eeb554ee65dc94811e1bd649c0719c97f7b7e","observation_id":"b80f73ab-759f-4a65-9d7a-ee91caaefc00","resolution":{"observed_at":"2026-08-15T18:20:42.249214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.227267Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"3a885b5a-15da-4e16-a9ab-6aabba289526","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.178318Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:111b02055b288d4b0874987f981ccbd549b67779b48613251c968efb44249ccc","observation_id":"1929c7a6-2409-45b9-b92f-c3a2d481be66","resolution":{"observed_at":"2026-08-15T18:20:42.232628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.210104Z","title":"Detrs with hybrid matching","venue":null,"work_id":"3ebc4cf1-05e2-4973-a159-202a41d75f98","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.182911Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:5ff21420e306e2f8320014a5ed69a2f4d7ba73647bb4738ccfff9435ce06284c","observation_id":"51dc8c80-68d7-4889-8fcd-79fc9d9758a3","resolution":{"observed_at":"2026-08-15T18:20:42.216107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.187182Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.187182Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:26eb9984088bd015029c342154eab7c3df5d536631006268f1f5d4de11bec794","observation_id":"9a0e7103-7d10-4fe2-9e0e-4f07eb61bc5c","resolution":{"observed_at":"2026-08-15T18:20:41.187182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.182215Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification","venue":null,"work_id":"68fa05bb-a846-422f-ac29-af79fbd1d258","year":2017},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.192354Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:beb7c561b8b67593870baf5b685967417e5f7319af9ebd2efa38bab471cfa2f7","observation_id":"9800eeba-e1b2-4715-a7a4-646b4b1401ad","resolution":{"observed_at":"2026-08-15T18:20:42.187371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-16T13:24:31.540262Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-15T18:20:41.196489Z","title":"Building and better understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.196489Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:972beaa47f8fe64cb2a87a706d60ca9d2e7a9a4951cdcf436faf7fbd9569f102","observation_id":"d39e0ca0-c515-4ee9-844a-d43e7d6201cd","resolution":{"observed_at":"2026-08-15T18:20:41.196489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.166444Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"3006bb49-ca0e-4a56-a136-7ad9dfca0e8e","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.201411Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:1d807c7ad40357130616f1977b225e00f68876f1415eeda37ef84106838ba826","observation_id":"476c6df1-cf32-4b2d-aa5b-90eddafff098","resolution":{"observed_at":"2026-08-15T18:20:42.171495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.149352Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"31250f0d-cb78-4d1e-a51f-4f6f181c65a6","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.205867Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:32002a5d14423160ec3f481e205fe9c0f80f1d6e987ac88c5f3166f6c552218d","observation_id":"565cd5ab-fd74-4391-99f2-b2b06f98ee1e","resolution":{"observed_at":"2026-08-15T18:20:42.154303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.132749Z","title":"Generative region-language pretraining for open-ended object detection","venue":null,"work_id":"234a65eb-7160-404b-adb7-40cad75d2941","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.210434Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:10a929806d050ab6869add032f72d09760613af6783202558016fb4826cfafcf","observation_id":"98281367-7eab-4f27-84a6-8d5c990339cc","resolution":{"observed_at":"2026-08-15T18:20:42.137555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.115651Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"98fe329f-88b8-4498-90e9-d0cd38a0d502","year":2014},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.214842Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:cee2b6823847f97e3ec66574d0fcacd31cfe28a971637de2dc58bb182f6f0368","observation_id":"082175c0-5c53-4bd6-8a3e-494d025f87be","resolution":{"observed_at":"2026-08-15T18:20:42.121477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.098534Z","title":"Visual instruction tuning","venue":null,"work_id":"2701dfc7-64ed-4d28-9b70-18e9fa485b12","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.219573Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:91d4c332d24468fc8b979f8527b7be1107b0a02e2d9d98f4d86e11c898523776","observation_id":"ee13eab0-2b8b-45fe-a68a-0c7b0b986ce9","resolution":{"observed_at":"2026-08-15T18:20:42.103453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.082887Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"1618e039-38d3-4036-baa2-232afd014aa0","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.224159Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:d31f55a6217cb7a46ca3c3f66f0633fba98243a6c2b700b796ccce6cef4cb094","observation_id":"1b120a8b-eab7-47e7-bd7f-7b30a3a458b1","resolution":{"observed_at":"2026-08-15T18:20:42.088137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-15T18:20:41.229099Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.229099Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:2013c9def39486e9103c8fb22d6a8be31dce98efcb6771ce8960ceaf533993af","observation_id":"e431bbaa-d72d-4f2a-8b53-69f2174f4a63","resolution":{"observed_at":"2026-08-15T18:20:41.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08166","last_updated":"2023-10-31T17:51:51Z","snapshot_observed_at":"2026-08-16T15:30:05.423984Z","submitted_at":"2023-10-12T09:39:17Z","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2310.08166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08166","snapshot_observed_at":"2026-08-15T18:20:41.651201Z","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","venue":"cs.CL","work_id":"c9500e1d-8077-4614-b400-704d38610965","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.233757Z"},"links":{"cited_paper":"/paper/2310.08166","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:4c13bc8bf9d9daeb4a0dcf0ca1a89639fde979fce6983db8be4730facdc1c9e3","observation_id":"98756f12-295d-4452-a514-451e1932840d","resolution":{"observed_at":"2026-08-15T18:20:41.658332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-16T13:59:24.125689Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-15T18:20:41.238757Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.238757Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:6ef5e01cc936535401c65196ab74535734def9cca3881e06ea53109704cbe5e9","observation_id":"c61919d6-a94b-425b-b8c5-06915cb95c05","resolution":{"observed_at":"2026-08-15T18:20:41.238757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.066188Z","title":"Scal- ing open-vocabulary object detection","venue":null,"work_id":"eac82227-433d-4cfb-8f6a-5fcbbb0a677d","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.243496Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c420db20ebe90a1a76ea90c7ad1a2faabffc525a09f7b206d5568f7cadafaa8d","observation_id":"052f5567-27c8-4b4c-be71-d7197552d3df","resolution":{"observed_at":"2026-08-15T18:20:42.071999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.049565Z","title":null,"venue":null,"work_id":"dd039f10-7eed-409d-bc68-3260a4b742ee","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.248336Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:b27df3a210df3007abe32290d6124de1b886a18b956e9759e8212eaf40b8e228","observation_id":"a00781fd-abed-48a2-acaa-09997f4b0545","resolution":{"observed_at":"2026-08-15T18:20:42.054615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-15T18:20:41.253210Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.253210Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:60d722f479f370c8b71c88d48f243c3c412703826dbf761b9d0abbced8a050c8","observation_id":"2f254c71-48af-45ae-932f-27a1aa2fa4ad","resolution":{"observed_at":"2026-08-15T18:20:41.253210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.033205Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"973de7d3-e0bc-4b02-8e10-a3a5affe96ba","year":2021},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.258353Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:77c6e9321e175263052527f18f95cf8004fe5eada69b6b279bc3cc46a844b694","observation_id":"b5139c15-b74f-43f1-bee1-28ef7c17ab29","resolution":{"observed_at":"2026-08-15T18:20:42.039031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.262855Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.262855Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:18e3d5d5ca40bea03274548328a914b3907b1ab2d4443f9382a34eff4dad8b53","observation_id":"0b4a0aea-8d96-4d95-9530-be0dd34651e0","resolution":{"observed_at":"2026-08-15T18:20:41.262855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.004536Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"fae1999f-d788-4d27-a4ba-838353cd2ea5","year":2016},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.267864Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:d6a83bc6fb31754cf45a4854625c8b569cd64b6fc4033f73ae004df44dbcd115","observation_id":"837f13fa-8959-442a-b801-bc624c644b0d","resolution":{"observed_at":"2026-08-15T18:20:42.010266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.988437Z","title":"Grounding dino 1.5: Advance the \"edge\" of open-set object detection, 2024","venue":null,"work_id":"66f387b1-fb5c-4843-94f6-49b9c6d0e55c","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.272251Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:ee9ce77db803825acc1493ba02955a281d1cb0b75d1517b67db709144409d7f4","observation_id":"6cd99452-18f4-4f55-99e5-0da38c2b3aa0","resolution":{"observed_at":"2026-08-15T18:20:41.993470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.973123Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"b8de574e-eee3-4e0b-ba83-16b551e756cc","year":2019},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.276858Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f36b75834228cfa06126b21e5f352f877687c1242b5b25073e7dec80a49df1c7","observation_id":"49ccb3ad-52a0-4065-a8cd-990bbf6c9447","resolution":{"observed_at":"2026-08-15T18:20:41.978046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.957531Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms, 2024","venue":null,"work_id":"28c55577-d276-4bd2-83bd-535af14041ff","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.281336Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:4def294e13abbb46e2a5ad9aed0e950f14158c278a2958c8716467966e110f71","observation_id":"b870a08f-6937-4ea0-895f-4d4287904f6e","resolution":{"observed_at":"2026-08-15T18:20:41.962458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.942416Z","title":"Iaa: Inner-adaptor architecture empowers frozen large language model with multimodal capabilities","venue":null,"work_id":"2adc76b1-7490-4254-b8b8-6eea76fcf8cc","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.285832Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:6cf5a2456c3bbdfa25d1a99130ae7443b1b01856e533ef92b594412898bb1160","observation_id":"0322734e-0a1e-4d52-b725-2d6e3fae8019","resolution":{"observed_at":"2026-08-15T18:20:41.947188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T18:20:41.290110Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.290110Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c9b324e4281ee23d8239e0371298cd9fddfe0ed372bea65c26f6ed5a27dc0bd2","observation_id":"468d53aa-7fe4-4c97-8da8-343b9e703d7b","resolution":{"observed_at":"2026-08-15T18:20:41.290110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-16T14:36:01.153196Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-15T18:20:41.295610Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.295610Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:493a5ec763996b87b87c98eca032fcbbc0ac1d13dd2fa262a8253d62c73ba02c","observation_id":"8fb52397-f1fb-4d66-8565-f7bb61048fbf","resolution":{"observed_at":"2026-08-15T18:20:41.295610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-15T18:20:41.300411Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.300411Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:58e101e4e81958de71b93c22e8ec869dde6d8d6ff285ddd6316f1e2ffbbae7c1","observation_id":"e79f9c03-8f8e-4163-8f48-d84cf427e9cc","resolution":{"observed_at":"2026-08-15T18:20:41.300411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-16T14:47:44.314161Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-15T18:20:41.304607Z","title":"Skywork: A more open bilingual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.304607Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:9e4ca63478228bd630f3d694d74eab2fdee3abec7a890696d19d0c83f9ea3d2b","observation_id":"be62617d-1ea0-40d5-a7ab-2180920b719e","resolution":{"observed_at":"2026-08-15T18:20:41.304607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.926673Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"16e96028-b99a-4277-922a-77fa6b59f62e","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.309479Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:ab1db7ba616594e2f6ebf1b792958aa2df6cc68138570bdf4f95986f99f7c279","observation_id":"ff4647ae-7bcd-46f1-b7d6-d1feb6494acd","resolution":{"observed_at":"2026-08-15T18:20:41.931671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.910209Z","title":"Deepseek- vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":"eaa9649e-7fa8-4248-a890-ce1970500709","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.315064Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8b9a57d76b2f396a1d0fec3645daf10dc95276151d6a84b85d1231cb3a0d1027","observation_id":"8ca45a51-e777-490b-9d47-ac8345db92a6","resolution":{"observed_at":"2026-08-15T18:20:41.915560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.893672Z","title":"Ccmb: A large-scale chinese cross- modal benchmark","venue":null,"work_id":"89ef8983-9d01-4517-91a1-82e5997679d4","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.319711Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:2fd4efb883a4d84b93737cb302615479a330cc153027eb37004ce237e7c3cc7b","observation_id":"046407b3-8617-4bad-93dd-d6babea75009","resolution":{"observed_at":"2026-08-15T18:20:41.899307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05071","last_updated":"2025-05-21T06:18:41Z","snapshot_observed_at":"2026-08-15T23:11:46.794725Z","submitted_at":"2025-05-08T09:06:53Z","title":"FG-CLIP: Fine-Grained Visual and Textual Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05071","snapshot_observed_at":"2026-08-15T18:20:41.324154Z","title":"Fg-clip: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.324154Z"},"links":{"cited_paper":"/paper/2505.05071","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:486d189aadc32dabf78e9fca154569fff95154fd1b9f2ee68b310529be1e62b6","observation_id":"4c9c66b6-a221-4452-863c-7827fa9e2d26","resolution":{"observed_at":"2026-08-15T18:20:41.324154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.877359Z","title":"Llava-cot: Let vision language models reason step-by-step, 2024","venue":null,"work_id":"5d07dc78-1d18-4d8b-ab0b-084cc8717a34","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.328936Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:e0e243bfa28b3e7caa056eb9535c9a33de865ad12b89760247ebdc6db4b0e3d8","observation_id":"a4af59aa-d814-470f-b77b-9845ee14c2f8","resolution":{"observed_at":"2026-08-15T18:20:41.882457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T18:20:41.333364Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.333364Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:4ae6bb083c6665400e9d2ea98cf773d12c29ec63227108e5dc3537a104c903af","observation_id":"e7e450db-e393-40cb-b8f8-ba493cc0aafc","resolution":{"observed_at":"2026-08-15T18:20:41.333364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-15T18:20:41.337989Z","title":"mplug-owl: Modularization empowers large language models with multimodality, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.337989Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f4db03c5ee7870fb5fc0dc8e1e31565130ab6b54ab24cbdc59d44200e3113ecd","observation_id":"36d87560-cc15-4da0-9f18-62bc53828daa","resolution":{"observed_at":"2026-08-15T18:20:41.337989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-15T18:20:41.343049Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.343049Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8d9dc9e10625c595f0217bd67850005207ca550b61de5801af6b7b07c3500322","observation_id":"25938f21-ddf7-4d62-b1a7-7c9a3aed47e2","resolution":{"observed_at":"2026-08-15T18:20:41.343049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.860595Z","title":"Griffon v2: Advancing multimodal perception with high-resolution scaling and visual-language co-referring, 2024","venue":null,"work_id":"fbeec279-bb83-40cf-b832-279861ce6685","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.347776Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:851a41025fd217e461528fae1647c136831b2097096cf0f607e42ede86a87db7","observation_id":"5bd2b0d3-8bcc-4278-b687-13d9cf31877b","resolution":{"observed_at":"2026-08-15T18:20:41.865686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.844409Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"ffc7635b-a78b-4055-9132-43cfa5136507","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.352754Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:7e18baa403052ed88a2fffd2559410f06063dcfc52d403c16f653ece67593308","observation_id":"05456998-e84d-446b-87f2-f5cab2bb312f","resolution":{"observed_at":"2026-08-15T18:20:41.849590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-16T14:37:24.049811Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-15T18:20:41.357690Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.357690Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:a65638c4509d3074a206338b45776edad397b2b0ba30a73122596a86baebe240","observation_id":"5adb5b21-dda0-4a01-98fe-8b0fe5af8fa1","resolution":{"observed_at":"2026-08-15T18:20:41.357690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T18:20:41.362335Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.362335Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:634c79dd2a0cb70a330e1728337f8eded25213ea5d72e3061a80e0febc474be9","observation_id":"8ff683b7-901f-48ef-a96f-1e6668a92687","resolution":{"observed_at":"2026-08-15T18:20:41.362335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-16T14:01:39.123151Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-15T18:20:41.367508Z","title":"Ferret-v2: An im- proved baseline for referring and grounding with large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.367508Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3b8435bbcfce79f01bfce22b93b930422ee693624f748341b67ec06e906bba01","observation_id":"acf63f30-37ca-40c5-8b35-65724dc9e9ef","resolution":{"observed_at":"2026-08-15T18:20:41.367508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.827171Z","title":"Detrs beat yolos on real-time object detection, 2024","venue":null,"work_id":"9538d0b5-3aa2-4bce-9975-c5fcb5a7ad55","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.372330Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:65101f0537131e6e38996cba72c20810146622c6de99f2104ebec7a20d51d514","observation_id":"acaece5a-8065-43db-ae5e-13efe8aae67f","resolution":{"observed_at":"2026-08-15T18:20:41.833175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T18:20:41.377155Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.377155Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3c295fa0284f68a02622df49356f1cffe4fd0cd58953a2a298af4fcec228e01b","observation_id":"841aa40c-cb43-4908-b970-6244ff139a4d","resolution":{"observed_at":"2026-08-15T18:20:41.377155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.811405Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"b0cc452c-178e-4309-9da6-1032a86493be","year":2021},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.381597Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:810f5b2e9f74dc719b839927d05c31f647e807fb46928115dc4c9f975785e124","observation_id":"f1f79241-7ff3-4be4-a236-f2768dab37fe","resolution":{"observed_at":"2026-08-15T18:20:41.816775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.795693Z","title":"Multi-step","venue":null,"work_id":"5cd6708d-eb54-4874-82f9-29e470481b5b","year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.385870Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:5a64fcd418589c14594a0f31cb52659f20b9b1f9df61b58eb7cce571c6cb3214","observation_id":"ae4fb308-6e4a-4e4b-92ce-a1acdf958aef","resolution":{"observed_at":"2026-08-15T18:20:41.800601Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T17:14:10.372588Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2507.18300."}