{"as_of":"2026-08-14T21:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2df26881382426237d0fda1a3dc5ff0d1d3fcfeab55eb1a2ad6902126dab8d15","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:34:02.333517Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18778/citation-record","integrity":"/paper/2412.18778/integrity","json":"/paper/2412.18778/citation-record.json","paper":"/paper/2412.18778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.617754Z","title":null,"venue":null,"work_id":"7ada833a-055d-42bc-bd53-35d4ca803e1c","year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.075673Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8bb3cff6e02579123750d8a592d665a418d52ac7553e520dfec8791700d2d21e","observation_id":"dfca2a14-6f44-4723-92be-7475724edc22","resolution":{"observed_at":"2026-08-11T04:34:03.622632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.080829Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.080829Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:df3fec5d4fdd86170eb746b40bf21443d837f8544451ff5c139df36bae819b69","observation_id":"d5f60d4d-aebd-49e7-a3c1-2f604f23040e","resolution":{"observed_at":"2026-08-11T04:34:02.080829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12872","last_updated":"2020-05-28T17:37:23Z","snapshot_observed_at":"2026-08-12T19:36:54.629925Z","submitted_at":"2020-05-26T17:06:38Z","title":"End-to-End Object Detection with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12872","snapshot_observed_at":"2026-08-11T04:34:02.085201Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.085201Z"},"links":{"cited_paper":"/paper/2005.12872","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:9090931433b17f66defb8e459ba0aeff3de6cb371a85176f28afe3a0075f1b64","observation_id":"3979f508-145e-4e9d-bb31-df8be4b80109","resolution":{"observed_at":"2026-08-11T04:34:02.085201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-08-12T23:06:26.489341Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-11T04:34:02.090460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.090460Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:df551c0e21aaaca5ac84151bd34741bebb2b51c9baab488dffad685d23c7bea5","observation_id":"0a088262-0ecd-4887-b30e-553124069d4f","resolution":{"observed_at":"2026-08-11T04:34:02.090460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09148","last_updated":"2023-05-02T17:06:51Z","snapshot_observed_at":"2026-08-14T13:18:14.681584Z","submitted_at":"2023-04-18T17:38:54Z","title":"SAM Fails to Segment Anything? -- SAM-Adapter: Adapting SAM in Underperformed Scenes: Camouflage, Shadow, Medical Image Segmentation, and More","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09148","snapshot_observed_at":"2026-08-11T04:34:02.095509Z","title":"Li, Lingyun Sun, Papa Mao, and Ying-Dong Zang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.095509Z"},"links":{"cited_paper":"/paper/2304.09148","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a1ace59a9c6fa7c293be5e27595b1a11a3894f3277dec4d75b84223b3e6be833","observation_id":"48f98527-4342-4056-9503-cfcd32e7f617","resolution":{"observed_at":"2026-08-11T04:34:02.095509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.100667Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.100667Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:6e85f6ec52b95de23d3c31f96798fbd811861e8a588587771f154739c2d7f0e9","observation_id":"d920fe8d-ec60-44e5-a3db-d792211ba781","resolution":{"observed_at":"2026-08-11T04:34:02.100667Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T04:34:02.105878Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.105878Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:4082c6649a93d18896dff3504239fc9595b4992e1c17ee4eb9176575dbdf57e5","observation_id":"068a3ac1-b34c-4d50-8f9f-8bc81fd6bf04","resolution":{"observed_at":"2026-08-11T04:34:02.105878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10274","last_updated":"2021-06-10T05:36:12Z","snapshot_observed_at":"2026-08-12T13:01:43.399928Z","submitted_at":"2021-02-20T06:49:53Z","title":"Concealed Object Detection","version":2},"cited_work":{"arxiv_id":"2102.10274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.10274","snapshot_observed_at":"2026-08-11T04:34:03.269936Z","title":"Concealed Object Detection","venue":"cs.CV","work_id":"ff21db25-b1d2-409c-a3a4-5b1c4e855904","year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.110714Z"},"links":{"cited_paper":"/paper/2102.10274","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:4e6e0dda118a67bf7d06c1187b7346783e2868b02cbb7b2fb5f30da116bbda9f","observation_id":"68fb8423-98e0-41b3-813a-0818bcd50c8d","resolution":{"observed_at":"2026-08-11T04:34:03.274848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.115665Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.115665Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c783dbd77929124c0d2cbf1ee6d8abfe0b087ce098a4ebe1fa24884a5af86507","observation_id":"1a0bf6ae-f741-46b5-8b39-7b5e7eeff726","resolution":{"observed_at":"2026-08-11T04:34:02.115665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-10T10:04:53.772315Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-11T04:34:02.120229Z","title":"Girshick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.120229Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:4206fa0b53897fdeb96aa36ef9223b5bad4a5747dd4f9f0d2716116afc4f27e4","observation_id":"73b23bca-a75f-4879-b3ec-1d13cfe03512","resolution":{"observed_at":"2026-08-11T04:34:02.120229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1311.2524","last_updated":"2014-10-22T17:23:20Z","snapshot_observed_at":"2026-07-06T03:27:53.279398Z","submitted_at":"2013-11-11T18:43:49Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1311.2524","snapshot_observed_at":"2026-08-11T04:34:02.124878Z","title":"Girshick, Jeﬀ Donahue, Trevor Darrell, and Jite ndra Malik","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.124878Z"},"links":{"cited_paper":"/paper/1311.2524","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:981d52b20ab330fa64574aa6368144e5ccd259fb21e8d959b18b3319c44c4705","observation_id":"f47e55f7-bccf-4bcf-9040-b5bcb3d395d2","resolution":{"observed_at":"2026-08-11T04:34:02.124878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.129567Z","title":"Goldberger, Luis A","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.129567Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:fa70ec2e34320aaf3121e99a43dafec1b05bbede1b272e7effee26a3231d4b3f","observation_id":"105fa00f-3743-44de-af76-3b0dce7e19c5","resolution":{"observed_at":"2026-08-11T04:34:02.129567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06263","last_updated":"2022-06-14T14:05:23Z","snapshot_observed_at":"2026-08-14T18:26:41.298229Z","submitted_at":"2021-07-13T17:47:19Z","title":"CMT: Convolutional Neural Networks Meet Vision Transformers","version":3},"cited_work":{"arxiv_id":"2107.06263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06263","snapshot_observed_at":"2026-08-11T04:34:03.144906Z","title":"CMT: Convolutional Neural Networks Meet Vision Transformers","venue":"cs.CV","work_id":"0b492e55-4457-492b-b6c0-d651da851c01","year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.133793Z"},"links":{"cited_paper":"/paper/2107.06263","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:b0c90394cee9ace488a6c8c724a023ed117cc0157b0504f4f6b33b2e196a8bd6","observation_id":"7b199c26-bcd3-467d-bd0b-566ff6fd9edb","resolution":{"observed_at":"2026-08-11T04:34:03.149792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.604355Z","title":null,"venue":null,"work_id":"0a8c2730-d797-49c3-ab8f-9be792acc307","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.138382Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:b16243da362f69ebb699eab1c1735fa4fd1629e778aa4f5837612aa768eceed0","observation_id":"4d20afe7-52e0-44dd-9c4f-b818083f4852","resolution":{"observed_at":"2026-08-11T04:34:03.608646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.4729","last_updated":"2015-04-23T07:33:24Z","snapshot_observed_at":"2026-08-07T04:13:47.671495Z","submitted_at":"2014-06-18T14:24:17Z","title":"Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.4729","snapshot_observed_at":"2026-08-11T04:34:02.146803Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.146803Z"},"links":{"cited_paper":"/paper/1406.4729","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:3c5db706113994501bbc0ad1b0b3120bb6bf12c95d8805192d0eff06a3b28331","observation_id":"3f033212-3b81-420b-b429-cefa7a0520a1","resolution":{"observed_at":"2026-08-11T04:34:02.146803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-11T04:34:02.151323Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.151323Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1d14acf60aef68e7216b1dd756a89c470a42ec0f678e533ab7f536469a68bcfb","observation_id":"4e8854c7-6b64-4e60-a66a-f5fe6cbfe725","resolution":{"observed_at":"2026-08-11T04:34:02.151323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.590669Z","title":null,"venue":null,"work_id":"8a65d319-5dc1-44b6-9ba8-dc6a8c882746","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.156743Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2f7c2be40767e68f5972f607dc51c7bb2e5b7e43e6187df35a96c29b15c96032","observation_id":"18bac6bf-cb98-427e-b1bd-b8855302fea2","resolution":{"observed_at":"2026-08-11T04:34:03.595134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.166020Z","title":"Berg, Wan- Yen Lo, Piotr DollÃąr, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.166020Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:e86167ee18d5dc5b20eed0c3f11a14529514cda55101c0742e454ccde510603e","observation_id":"5e0380c1-9d67-4cdf-8679-c1428be32ecf","resolution":{"observed_at":"2026-08-11T04:34:02.166020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00414","last_updated":"2019-07-19T14:59:45Z","snapshot_observed_at":"2026-08-14T16:38:38.742173Z","submitted_at":"2019-05-01T17:57:26Z","title":"Similarity of Neural Network Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00414","snapshot_observed_at":"2026-08-11T04:34:02.170332Z","title":"Hin- ton","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.170332Z"},"links":{"cited_paper":"/paper/1905.00414","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2b69d7e986869a804fbe43c9bdbd488d5d51374baf931357a39826422e5fc593","observation_id":"41fab339-7f56-48a0-9a2f-c9fb48f9f650","resolution":{"observed_at":"2026-08-11T04:34:02.170332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01244","last_updated":"2019-03-18T18:58:40Z","snapshot_observed_at":"2026-08-14T18:44:43.763069Z","submitted_at":"2018-08-03T16:05:55Z","title":"CornerNet: Detecting Objects as Paired Keypoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01244","snapshot_observed_at":"2026-08-11T04:34:02.174795Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.174795Z"},"links":{"cited_paper":"/paper/1808.01244","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8af8038433af58e98ca27e0109b27445ba07c207fc2c4a941cc07ca5cafea5ec","observation_id":"0fbd79ba-4e3a-41c8-86c9-8fcbffbf3bae","resolution":{"observed_at":"2026-08-11T04:34:02.174795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20077-9_17","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":null,"venue":"Lecture notes in computer science","work_id":"99cd897f-42f5-4746-aa7b-34b1ff1370d9","year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.178742Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:d553f7a320fa9e18b703165f345338b81e3624dca03be7e350794597ccf03138","observation_id":"2a5c7759-8818-4780-8eff-913e32be5057","resolution":{"observed_at":"2026-08-11T04:34:02.413966Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03144","last_updated":"2017-04-19T22:46:32Z","snapshot_observed_at":"2026-08-14T21:26:15.443244Z","submitted_at":"2016-12-09T19:55:54Z","title":"Feature Pyramid Networks for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03144","snapshot_observed_at":"2026-08-11T04:34:02.182700Z","title":"Girshick, Kaiming H e, Bharath Hariharan, and Serge J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.182700Z"},"links":{"cited_paper":"/paper/1612.03144","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:fc155d0a27e3975a5a90f00b74d81e69750c447a69f72bb4e7ff68a4d9c35f85","observation_id":"1e348a27-9edb-4e0d-91db-1b652d3c0096","resolution":{"observed_at":"2026-08-11T04:34:02.182700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.576405Z","title":"Girshick, Kaiming He , and Piotr Dollár","venue":null,"work_id":"c201772c-ac26-40ce-94af-879145381ccc","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.186774Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a8b0d21555d91c13de902b1505de0313b475953f046dc655eeaabab8d91ab27f","observation_id":"25fce831-bc8a-4da2-abaf-37d25035ce0f","resolution":{"observed_at":"2026-08-11T04:34:03.581831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.562949Z","title":null,"venue":null,"work_id":"c29c50e7-bf2b-4a8e-805e-429abfbe523b","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.195040Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:f0990563c968daa8c4bda7898f3bf2a76bce6f250f4d1a336e000538e82df6df","observation_id":"49fa9b09-8bcd-46f6-851d-962f147d5bd9","resolution":{"observed_at":"2026-08-11T04:34:03.567191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02325","last_updated":"2016-12-29T19:05:11Z","snapshot_observed_at":"2026-07-06T04:39:05.325036Z","submitted_at":"2015-12-08T04:46:38Z","title":"SSD: Single Shot MultiBox Detector","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02325","snapshot_observed_at":"2026-08-11T04:34:02.204149Z","title":"Reed, Cheng-Yang Fu, and Alexander C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.204149Z"},"links":{"cited_paper":"/paper/1512.02325","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a4cf985d397f38172faa8c8d7bab92e37f54411201f9468a056c848f040ebcf9","observation_id":"c840ed8a-a38c-41c4-8cec-df60ba1f1fd0","resolution":{"observed_at":"2026-08-11T04:34:02.204149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09883","last_updated":"2022-04-11T16:03:17Z","snapshot_observed_at":"2026-08-13T17:31:46.444128Z","submitted_at":"2021-11-18T18:59:33Z","title":"Swin Transformer V2: Scaling Up Capacity and Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09883","snapshot_observed_at":"2026-08-11T04:34:02.208712Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.208712Z"},"links":{"cited_paper":"/paper/2111.09883","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:b3973f7bb3ea3aa50f3c052664a4d4030a78b4213e3b60e1f85832b2d63de83e","observation_id":"e5939e69-769e-4628-bc2f-7753a423bb68","resolution":{"observed_at":"2026-08-11T04:34:02.208712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07784","last_updated":"2022-12-16T09:47:56Z","snapshot_observed_at":"2026-08-13T13:21:55.786745Z","submitted_at":"2022-12-14T18:50:20Z","title":"RTMDet: An Empirical Study of Designing Real-Time Object Detectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07784","snapshot_observed_at":"2026-08-11T04:34:02.217206Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.217206Z"},"links":{"cited_paper":"/paper/2212.07784","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:05ca085a52ebb5b02620a7b3c0d4809869beabbdf8f0fbf1884c282ee60c2b1a","observation_id":"0d9511f5-4150-4826-96ba-6f00a2c07783","resolution":{"observed_at":"2026-08-11T04:34:02.217206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.535746Z","title":null,"venue":null,"work_id":"d4eca797-1ffc-4f0b-b194-f39fe14bd346","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.221711Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:0dd34414524d3ed3f287d523f7a576d652ae766f07afa3808ec26c2e58eb817a","observation_id":"c1c495be-6c38-42eb-b4fb-2fd689ef2ef1","resolution":{"observed_at":"2026-08-11T04:34:03.540028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.521401Z","title":null,"venue":null,"work_id":"3111de9c-edb5-4b56-bc57-2d82af6f202e","year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.230494Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:b9901a439769a586c0afdf6e92425dbff3736e1b6d965fb3b1d4b47d220c1a47","observation_id":"d6eb5e06-7cb7-4b5f-ac19-fbf15ba2712c","resolution":{"observed_at":"2026-08-11T04:34:03.526104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.234743Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.234743Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1bf5415347f30f895db7193ddd33885fe90522ef3318fea489224790f82c07ad","observation_id":"87c790a6-80dd-4393-9a0f-9a4c6f5a99d6","resolution":{"observed_at":"2026-08-11T04:34:02.234743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.506587Z","title":null,"venue":null,"work_id":"6a2e3446-6916-460c-85da-965e784b78bc","year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.239108Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:98f97fd7038988a5a90795e92f68058ad76af84fa012624298c02dfe2cacd983","observation_id":"c6c93072-9be3-4538-a6fb-5a78a6b4ac23","resolution":{"observed_at":"2026-08-11T04:34:03.511260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.491466Z","title":null,"venue":null,"work_id":"2992d1fb-904b-4c73-a1c2-c38077b40678","year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.243315Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ddbf8adb9ba0c7a5edcf14a9469c0efb7a0bb4bb4fd6c12827a3e1c87cb9d9a5","observation_id":"834b2e6d-3e01-47f3-9800-b6ba83bd9411","resolution":{"observed_at":"2026-08-11T04:34:03.495960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-25082-8_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":"In Computer Vision âĂŞ ECCV 2022 Workshops: Tel A viv, Israel, October 23âĂŞ27, 202 2, Proceedings, Part VII (Tel Aviv, Israel)","venue":"Lecture notes in computer science","work_id":"2b808c4b-e389-4644-be43-00c79fd717f5","year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.226254Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:5702de1b94ffb7c49d7c08011d59a1c433b15b5364320f51a265aed46b6d5fa9","observation_id":"aa493100-75dd-4e97-98e5-8a631db8c28d","resolution":{"observed_at":"2026-08-11T04:34:02.399237Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.252092Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.252092Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:71a3a8e948fa8370ecbb6a44c413c690cbd35114bf9d2045207e774cb8408442","observation_id":"3608339d-eaf3-479d-b709-927492599dfb","resolution":{"observed_at":"2026-08-11T04:34:02.252092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02640","last_updated":"2016-05-09T22:22:11Z","snapshot_observed_at":"2026-08-13T12:28:29.534909Z","submitted_at":"2015-06-08T19:52:52Z","title":"You Only Look Once: Unified, Real-Time Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02640","snapshot_observed_at":"2026-08-11T04:34:02.256193Z","title":"Girshick , and Ali Farhadi","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.256193Z"},"links":{"cited_paper":"/paper/1506.02640","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2dd1e1a7dc76c22f248e0c97a472b3a846bb19b7024c4ba1787ee7206b57aead","observation_id":"6349ec22-1f98-4cb8-852a-556dc607d144","resolution":{"observed_at":"2026-08-11T04:34:02.256193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-07-06T04:19:53.343717Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-11T04:34:02.260971Z","title":"Girshick, and Jian Sun","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.260971Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:874798d18f13c5eff15b875809a1c308ce19b4cda57b083a12b8b54312c20f80","observation_id":"92ad948b-d174-40e3-a31e-ad24d503f29b","resolution":{"observed_at":"2026-08-11T04:34:02.260971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.265565Z","title":"Wu, Safwan S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.265565Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:9c2891382c7934779d3a60a3c65fa3f5fd665b7c82c1311b4f4f9f597a506e36","observation_id":"6e0e3ab7-ea8d-4460-8a77-87b671302cff","resolution":{"observed_at":"2026-08-11T04:34:02.265565Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13678","last_updated":"2020-03-30T17:57:47Z","snapshot_observed_at":"2026-08-12T10:40:16.751027Z","submitted_at":"2020-03-30T17:57:47Z","title":"Designing Network Design Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13678","snapshot_observed_at":"2026-08-11T04:34:02.247765Z","title":"Girsh ick, Kaiming He, and Piotr Dollár","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.247765Z"},"links":{"cited_paper":"/paper/2003.13678","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:fd5c00c8a3dfa25c02eba3f47f97660f614a9f3d806b707ea7e71201a089b25c","observation_id":"3c005129-e5c7-4535-b446-c23dfc39da68","resolution":{"observed_at":"2026-08-11T04:34:02.247765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11946","last_updated":"2020-09-11T05:08:01Z","snapshot_observed_at":"2026-08-10T19:44:30.311627Z","submitted_at":"2019-05-28T17:05:32Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11946","snapshot_observed_at":"2026-08-11T04:34:02.274332Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.274332Z"},"links":{"cited_paper":"/paper/1905.11946","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:af1bf9a2ccd74d0e74aeb87d3f82c16c7d8bd4a1a25377267078f3caa715378c","observation_id":"ba13177f-9bf0-471e-9195-d98182a76eef","resolution":{"observed_at":"2026-08-11T04:34:02.274332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-11T04:34:02.278900Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.278900Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ba203f85df21d348ece911954b84a3e6f8f5aac7ce87f1bbff05cf5313f85a1a","observation_id":"16d5f83c-c569-413c-9e76-288417e3fba6","resolution":{"observed_at":"2026-08-11T04:34:02.278900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12122","last_updated":"2021-08-11T12:38:21Z","snapshot_observed_at":"2026-08-12T02:38:40.213189Z","submitted_at":"2021-02-24T08:33:55Z","title":"Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12122","snapshot_observed_at":"2026-08-11T04:34:02.283296Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.283296Z"},"links":{"cited_paper":"/paper/2102.12122","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a218b195d4378bd608f2f7b0a2bb88fb83e9d9d8b15050ec33f83f894c82545c","observation_id":"777a7d41-9015-43dd-b854-7f2413e41bec","resolution":{"observed_at":"2026-08-11T04:34:02.283296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.287811Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.287811Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8e291888c75e717df79edb712821d078eda0232b273a8dcdd2b05118b4458e48","observation_id":"3e7a63b4-e830-4d54-8eb5-e6acd6f21135","resolution":{"observed_at":"2026-08-11T04:34:02.287811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T04:13:35.056640Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T04:34:02.269929Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.269929Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:aeb7a6b15eecf83a6824343f62933917a837f4633b04de49841eb63468fadcf2","observation_id":"7a4333fc-7eb7-43bd-b467-216f5ccae013","resolution":{"observed_at":"2026-08-11T04:34:02.269929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.477726Z","title":null,"venue":null,"work_id":"ac898c8f-9734-4a60-bcd0-224d1471e4d5","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.296177Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a09b9da947d7582ece473837b69cbd4432c1780bfb8fb041860de8401a25efbb","observation_id":"a5c2843f-2825-4012-a6e8-b5efc510faab","resolution":{"observed_at":"2026-08-11T04:34:03.482056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15808","last_updated":"2021-03-29T17:58:22Z","snapshot_observed_at":"2026-08-14T02:46:33.278137Z","submitted_at":"2021-03-29T17:58:22Z","title":"CvT: Introducing Convolutions to Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15808","snapshot_observed_at":"2026-08-11T04:34:02.303884Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.303884Z"},"links":{"cited_paper":"/paper/2103.15808","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2bb14c324c47824a83e9a3ab4ffb6f04284734f6ba042e9123ce7e8b1601bedc","observation_id":"c18b2d64-e096-4035-98aa-d7ef4360257b","resolution":{"observed_at":"2026-08-11T04:34:02.303884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00520","last_updated":"2022-05-24T12:52:37Z","snapshot_observed_at":"2026-08-13T17:04:59.651885Z","submitted_at":"2022-01-03T08:29:01Z","title":"Vision Transformer with Deformable Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00520","snapshot_observed_at":"2026-08-11T04:34:02.307775Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.307775Z"},"links":{"cited_paper":"/paper/2201.00520","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ed16eae257c6d16295478186ad0cb56fde0a6d3d86271ce8dd4e08a464c71a72","observation_id":"7e4fd844-f2b2-405a-bf3a-98dd106fe840","resolution":{"observed_at":"2026-08-11T04:34:02.307775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01430","last_updated":"2023-09-04T08:26:47Z","snapshot_observed_at":"2026-08-13T10:20:59.402035Z","submitted_at":"2023-09-04T08:26:47Z","title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01430","snapshot_observed_at":"2026-08-11T04:34:02.312181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.312181Z"},"links":{"cited_paper":"/paper/2309.01430","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:228861b8b177f3c6dfb528f5d7df311b8423b3fb55ab8346eec51371871490bc","observation_id":"0cd8eb6a-d2a0-466b-a740-54b8b849facf","resolution":{"observed_at":"2026-08-11T04:34:02.312181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.292082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.292082Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:10d66d1a512f7c4c3c34d394676633910b593974db7821cd3a1e7705fe7ac005","observation_id":"111a8269-85dd-4803-87e2-86f69389b322","resolution":{"observed_at":"2026-08-11T04:34:02.292082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.434385Z","title":null,"venue":null,"work_id":"d9f4772b-5b49-4833-a090-2aca53b1e2a0","year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.320053Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:253be33315b18f8bd2d45dc9999a0366dfd6d52509abb7033ac2c9378864c1e3","observation_id":"02108eb6-d90c-429b-9cdb-33eb7c7c405f","resolution":{"observed_at":"2026-08-11T04:34:03.439246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.463458Z","title":null,"venue":null,"work_id":"71ddbdb9-df08-4dcc-a344-a605172b7dea","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.300079Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c77ced3e983e3d4ca1b79a5f28c2e94367014a461a520b0529fca3a754cececc","observation_id":"b92fc2b6-7f21-40f3-bdb9-c60dbe31c84b","resolution":{"observed_at":"2026-08-11T04:34:03.468138Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02605","last_updated":"2022-07-29T06:39:56Z","snapshot_observed_at":"2026-08-13T17:02:48.063212Z","submitted_at":"2022-01-07T18:57:19Z","title":"Detecting Twenty-thousand Classes using Image-level Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02605","snapshot_observed_at":"2026-08-11T04:34:02.329007Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.329007Z"},"links":{"cited_paper":"/paper/2201.02605","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:5c1583bb5a3d3c9fe7bfee3bcd8757a94929cba1762bcbe2a9a1fdd88773ef41","observation_id":"e8ab321e-0a2c-4bc5-9805-592a55e3392e","resolution":{"observed_at":"2026-08-11T04:34:02.329007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-11T04:34:02.333517Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.333517Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8103ef6ba9c7a6600ca6a992cd481701e4b42af3564947c88b8f770ad93c14f5","observation_id":"a20076af-da48-43d9-98a2-2ffe6485f391","resolution":{"observed_at":"2026-08-11T04:34:02.333517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.449402Z","title":null,"venue":null,"work_id":"2dcd0752-295f-4ba1-a29e-b3f83bfe880f","year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.316240Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ad59d80ad438a8fb8e4d2210de58c03ec20ab2ecd5587d8e30ff8447d1cc5ea9","observation_id":"425a0832-06ff-48f9-aa15-a3124d76c745","resolution":{"observed_at":"2026-08-11T04:34:03.453889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03714","last_updated":"2021-06-07T15:24:54Z","snapshot_observed_at":"2026-08-13T19:08:32.260563Z","submitted_at":"2021-06-07T15:24:54Z","title":"Refiner: Refining Self-attention for Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03714","snapshot_observed_at":"2026-08-11T04:34:02.324295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.324295Z"},"links":{"cited_paper":"/paper/2106.03714","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:9f251ed011041eeeda2e9b81f703a8bd4178bf0d0f6b4ac85f6147511dab0add","observation_id":"2d71f19f-a4f0-471d-915b-09ef6c0ecb1f","resolution":{"observed_at":"2026-08-11T04:34:02.324295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-08-14T20:42:52.429547Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-11T04:34:02.190793Z","title":"CoRR abs/1708.02002 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.190793Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:79ee2533c6ad87bda49d4a9a2691070128f817b98188a45f15936516e1c6b038","observation_id":"8a833448-8f08-4bad-9398-4f50009ee08c","resolution":{"observed_at":"2026-08-11T04:34:02.190793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.549639Z","title":"In European Conference on Computer Vision","venue":null,"work_id":"840a3ab2-d4da-4342-9e08-270ba844ba1f","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.199377Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c5805b3968298af653260c7432d23f72d48091f866420c74a2e5f0f59d320bb1","observation_id":"37315f81-30d0-4d19-b9a3-87a0d21739dc","resolution":{"observed_at":"2026-08-11T04:34:03.553975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.142594Z","title":"In 2023 IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.142594Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:3986945aa872865a395c76dbcc1bb0bfcc0137733f52eb9427aa227f33cfddc9","observation_id":"2abe69fa-245a-45ba-b72f-dc6f285dc221","resolution":{"observed_at":"2026-08-11T04:34:02.142594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06842","last_updated":"2024-10-09T13:02:50Z","snapshot_observed_at":"2026-08-12T22:27:18.408933Z","submitted_at":"2024-10-09T13:02:50Z","title":"SurANet: Surrounding-Aware Network for Concealed Object Detection via Highly-Efficient Interactive Contrastive Learning Strategy","version":1},"cited_work":{"arxiv_id":"2410.06842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06842","snapshot_observed_at":"2026-08-11T04:34:03.021746Z","title":"SurANet: Surrounding-Aware Network for Concealed Object Detection via Highly-Efficient Interactive Contrastive Learning Strategy","venue":"cs.CV","work_id":"5c962865-51bd-4bd8-b271-5e769b05fc78","year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.161232Z"},"links":{"cited_paper":"/paper/2410.06842","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:0311ca5a73c82728c1b0a06c2fd4f8bd0b24ec7b103779d1a240b29e19901bf1","observation_id":"c0795a57-27f5-48de-a036-56cbc66feb09","resolution":{"observed_at":"2026-08-11T04:34:03.027113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T12:02:47.564394Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2412.18778."}